说的实在,确实如此!
ran z
@ran z
-
自研工作流,最新进展 -
3090 24G 跑QWOPUS 3.6 27B mtp 131K上下文 KV(Q8_0) 55TOK/S 智能开关思考- 最终配置,再也不折腾了(6月14日更新)5090移动版也是24g,能抄作业吗?
-
llama.cpp+qwen3.6-27b 初步测试@rock-shi 那就对了,24G跑128K上下文+MTP资源不够
我27 q4量化,kv均q8_0量化,上下文128k,MTP, 5090laptop 24GRAM,开thinking,50+tps,快的起飞啊
厉害!一样的卡,大哥能给个作业抄吗?14900k,32g内存,llama.cpp,感谢!