Qwen3.6 35B A3B UD Q6模型
96K上下文缓存,
67.28 token/s

Qwen3.6 35B A3B UD Q6模型
96K上下文缓存,
67.28 token/s

(
Q6版本, 如果是Q4 速度会更快一些
投机采样 32.8tokens/s
正常模式 约20tokens/s, 忘记拍照了,大约21 左右
Q4_K_M · 1500 tokens 测试结果
| 指标 | 值 |
|-------------|------------------------------------|
| 生成速度 | 53.5 tok/s 🚀 |
| 总耗时 | 28.0s |
| MTP 接受率 | 60.8%(1592 draft / 968 accepted) |
| Prompt 处理 | 115.4 tok/s(prompt cache 命中) |

draft=3
Qwen3.6-27B 词元生成速度测试
| 指标 | 值 |
|----------|------------------------|
| 生成词元 | 559 个(全文自然结束) |
| 耗 时 | 13.82 秒 |
| 速 度 | 40.44 tok/s |
比上次的 31 tok/s 还快了一些,可能是因为长上下文下 MTP 的并行预测效率更高。
用MTP版本,速度更快。

好的,谢谢。不同框架都试了,llama,ollama,vllm,lm stduio,然后35b,32b,30b,27b ,然后带MTP,然后q4、q5、q6, 说试了20多个模型感觉说少了,哈哈。一直没时间找测试的软件。自己瞎测一个,感觉不好用的就pass了,也没有调过参数。后面才知道参数对速度影响也挺大的。现在基本确定27b mtp版本的,推理能力和响应速度都不错。
用rocm比vulkan聪明一点,7个答案都给出了。计算时间差不多。
rocm也是q5,但是k q5,v q4
让我逐步推理:
五个位置 1-5(从左到右),条件:
@sospda 同样一辆车, 有的人跑赛道是10分钟, 有的人跑同样的赛道是5分钟。 有的人抱怨这个车真是垃圾,太难操控。 有的人精进自己的能力,去熟悉这辆车的操作,把它的性能发挥到最大。 智人跟猴子最大的不同,就是会使用工具,现代人跟智人的不同,就是现代人知道如何更好地去使用工具。
说那么多有啥用,你测试过没?要多久?如果没有试过,可以试试。
同一个问题, 不同的模型反应速度不同, 足以证明在该问题下不同的模型的智能程度。
也说明了,在该问题下,有些模型还有进步空间。
这有什么问题吗?
我发现了这一现象,提出来,不代表我就不去提升我的技能。
这是两码事。

vllm也能跑通

R9700+ 27B