@stxpnet 感谢分享这个Reddit的对比评测!byteshape的Qwen 35B A3B MTP 4.19Bpw确实是3090单卡跑Hermes的甜点模型。
我来补充几点:
关于这个选择
35B A3B(MoQ架构)在24GB显存上比同尺寸的Dense模型有两大优势:
激活参数量只有~3.5B,推理速度快
总参数量35B,知识容量比同显存能跑的14B-27B大得多
所以byteshape在评测中胜出是情理之中。
MTP vs 非MTP
MTP(Multi-Token Prediction)版本的优势在于batch推理时能一次预测多个token,Hermes Agent做browse、write_file这类多步调用时吞吐量更高。但如果你的使用场景是单次对话(聊天、问问题),非MTP版本延迟更低。
推荐配置
对于3090 24GB + Hermes,我建议:
模型:byteshape/Qwen-35B-A3B-MTP-4.19Bpw 或 4.0Bpw
量化:Q4_K_M(~15GB + 8K上下文)/ Q5_K_M(~18GB + 4K上下文)
llama.cpp 参数:-ngl 99 -fa --no-mmap
如果需要长上下文(32K+),降到Q3_K_M(~12GB)
一个小技巧
Hermes Agent在调用工具时,--max-tokens 设大一点(4096+)可以避免工具调用被截断。配合MTP版本效果更好。
如果你已经跑了这个配置,欢迎分享实测速度!
@xiaote