感谢楼主分享,如果可以,试试INT4是否能正常运行,感觉这个更有意义,毕竟当下显存太珍贵了。
neo
-
双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功 -
llama.cpp目前有重大性能BUG:checkpoint的巡回逻辑对于混合模型(比如qwen3.6-27B)无效,从而导致大概率每次对话都要prefill全文,严重拖慢速度@laobenxiong hermes每个N轮对话,会自动运行一个background_review,总结对话中的记忆和skill,在单slot中会导致system prompt与之前的不一致,所以prefill全部失效,而且hermes硬编码这个任务必须主模型亲自来完成,对于目前的llama.cpp版本来说确实不太友好。
-
llama.cpp目前有重大性能BUG:checkpoint的巡回逻辑对于混合模型(比如qwen3.6-27B)无效,从而导致大概率每次对话都要prefill全文,严重拖慢速度@terry 是的,本来第一目标也是sglang,奈何有目前无法逾越的问题,只能退而求其次了。
-
llama.cpp目前有重大性能BUG:checkpoint的巡回逻辑对于混合模型(比如qwen3.6-27B)无效,从而导致大概率每次对话都要prefill全文,严重拖慢速度@kop-wang 大神不敢当,小学生而已,共同进步。你的情况我没有遇到,也许可以先关闭cuda-graph或前缀缓存启动一次试试,实在不行用我现在这个模型试下:shawnw3i/Qwen3.6-27B-AWQ-MTP,参考启动参数:
vllm serve /path/to/models/Qwen3.6-27B-AWQ-MTP
--tensor-parallel-size 2
--max-model-len 262144
--gpu-memory-utilization 0.88
--kv-cache-dtype fp8
--max-num-seqs 2
--reasoning-parser qwen3
--enable-auto-tool-choice
--tool-call-parser qwen3_coder
--port 9527 --host 0.0.0.0
--trust-remote-code
--served-model-name Qwen3.6-27B-AWQ-MTP
--max-num-batched-tokens 16384
--enable-prefix-caching
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
另外如果要用turboguant(跟MTP有兼容性问题),现在的版本需要先合并issues里的两个补丁,或者等0.23版本,以上希望可以帮到你。 -
llama.cpp目前有重大性能BUG:checkpoint的巡回逻辑对于混合模型(比如qwen3.6-27B)无效,从而导致大概率每次对话都要prefill全文,严重拖慢速度是的,这个问题困扰我挺久了,严重影响任务节奏,前几天换成VLLM后,目前感觉还挺不错,开启前缀缓存,hit百分之八九十,开MTP后推理速度跟llama相差无几,而且可以多任务并行,如果不想折腾推荐先用vllm。SGLANG运行Qwen3.6 INT4时目前兼容度还不是很好,有bug,注意避坑。
-
实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率感谢楼主的分享,经过几天测试,发现使用后确实kv缓存被prefill的次数明显减少,这点非常到位,同时也发现在hermes中agent调用工具时频繁出现只说不做的情况,不知大家是否也有这样的情况?我准备试着结合Qwen原版和Fix版本合成一个新的版本来测试一下,有相同情况的朋友可以来指导探讨下。
-
小白求助:2*2080Ti 22G还是2*3080 20G劝你3080 20G,架构比2080新一代,有代差的,而且估计一年以后2080很多框架新版本不会再兼容2080了,显存带宽差不多翻一倍,这个很重要啊。
唯一缺点:魔改卡,散热必须做好,还有质保很重要。
有一句话:花3090一半的钱,买3090百分之80的性能说的就是它。 -
实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率牛牛牛,加了Qwen-Fixed-Chat-Templates之后,测试了下,缓存果然没有不命中了,没毛病
-
大模型16G卡的春天我今天刚好遇到这个问题,双q4_0,在hermes中context跑到50~60k,agent说话会开始漂移了,不过50k以内是可以的。
-
欢迎来到抡锤者社区!各位道友,有礼了