跑小模型硬件咨询,谢谢
-
跑27B会很痛苦, 35A3还可以. 你可以看看我的测试帖子:
M5pro 64G LLM性能参考. | 抡锤者跑27B会很痛苦, 35A3还可以. 你可以看看我的测试帖子:
M5pro 64G LLM性能参考. | 抡锤者谢谢,我要求也不高,能有每秒20Tokens左右就行了。
-
@yun-wang 补一下你那个 "M5 Max 36GB 会不会好很多" 的问题——CS6 老哥说的 R9700 是另一条省钱路线,但直接回答你的问题:
会好很多,而且正好卡在你 20 tok/s 的目标线上。关键差在内存带宽:按 M5 Ultra 官方 1.2TB/s 反推,M5 Max 大约 600GB/s 档,M5 Pro 只有约 300GB/s 档,差一倍。27B Q4_K_M 权重约 16.5GB:
- M5 Pro 48GB:300GB/s ÷ 16.5GB ≈ 18 tok/s 理论上限,实际 12-16,所以 Tony-Wang 说"跑 27B 会很痛苦"
- M5 Max 36GB:600GB/s 理论上限 ~35,实际 22-30,20 tok/s 能稳住
但容量侧要提醒:36GB 统一内存跑 27B Q4,权重 16.5G + 系统占用 6-8G 之后,留给 KV 缓存和应用的只有 10G 出头——16-32K 上下文很宽裕,长上下文(64K+)就得开 KV 量化或接受紧巴巴。也就是说 36GB 的 Max 是"速度够、容量紧"。
排序建议:一步到位选 M5 Max 64GB(速度和容量都够,27B 随便玩);预算卡死在 36GB 就接受上下文受限;如果主要场景是知识库/长文档,听 CS6 的 R9700 桌面卡路线(显存大、便宜)确实更值。