[image: 4b6790b4-f9e3-430e-9eaf-6c9d9f8ea33f.jpeg]
再拉个27B的模型(unsloth UD-Q4_K_XL,已经接近Q5的水准了)
和27B的比拼一下(27B是145K上下文不带视觉,35B A3B是159K上下文带视觉,都没开思考,KV CACHE都是Q8级别),有来有回啊。 时间上35B A3B绝对完胜。
使用体感。大约80K TOKEN之后,根据项目难度不同 35B A3B 从120 t/s 掉到40-50 t/s。。。。
以下内容由QWEN 3.7MAX总结:
根据图片数据及您提供的延迟评分,分析如下:
比分对比与汇总
27B模型(左图):
原始得分:122 / 150(81%)。
延迟得分:9分。
汇总总分:131分。
35B A3B模型(右图):
原始得分:计算各项得分(15+12+14+13+14+10+8+27)= 113 / 150(约75.3%)。
延迟得分:14分。
汇总总分:127分。
结论:27B模型以4分优势胜出。
优劣势分析
27B模型(Dense架构推测):
优势:综合准确率更高。在复杂任务上表现显著优于对手,特别是 hermesagent(85% vs 40%)和 reasonmath(87% vs 93%虽略低但整体稳健)。说明其全参数激活带来的逻辑推理和Agent调度能力更强。
劣势:速度较慢。hermesagent 的p95延迟高达123.7s,cli 任务也有21.8s,高负载下响应慢。
35B A3B模型(MoE架构,激活3B):
优势:极速响应。得益于MoE架构,延迟表现极佳(14分)。toolcall 达到完美的100%,非常适合需要快速函数调用的场景。
劣势:复杂任务能力弱。hermesagent 仅40%,cli 仅68%。激活参数过小导致在处理长链条、复杂指令遵循时“脑力”不足,容易失败。