微星 B660M 迫击炮 + 4060Ti 16G + i7-12700K + DDR4 32G,本地部署 Qwen3.8-27B 怎么吐字最快?
-
配置如下:
- 主板:微星 B660M 迫击炮(第一根 x16 槽是 CPU 的 PCIe 4.0 x16,第二根 x16 长槽是芯片组的 PCIe 3.0 x4)
- 显卡:RTX 4060Ti 16G 单卡
- CPU:i7-12700K
- 内存:DDR4 32G
想本地跑 Qwen3.8-27B(稠密 27B),请教几个问题:
-
单卡 16G 显然装不下 27B 权重(Q4_K_XL 就 16G+)+ KV 缓存,必然 offload 到内存。这种单机单卡 + 32G DDR4 的 offload 方案,实测吐字大概能到多少 t/s?是不是基本就是“慢成乌龟”?
-
想提速最划算的路子是不是再淘一张 16G 卡(第二张 4060Ti 16G 或 5060Ti 16G)组双卡 32G,走 llama.cpp 张量并行(-sm tensor -ts 1,1)+ MTP?B660M 副槽只有 PCIe 3.0 x4,跑 27B 推理带宽够不够用?
-
量化与参数:27B 上 Q4_K_M / UD-Q4_K_XL 就行了吧?MTP 的 spec-draft-n-max 在双 16G 卡上设 1 还是 2 比较稳(怕 OOM)?上下文开到 64K 是不是就只能放弃 KV 量化?
论坛里看过双 3060(24G) 跑 43~50 t/s、双 5060Ti 65 t/s 的帖子,想确认下我这板子加第二张卡是否是最优解,还是单卡硬扛有更聪明的办法。谢谢各位大佬!
-
三个问题分开答,都有论坛实测数据支撑:
-
单卡 offload 速度:4060Ti 16G 跑 27B Q4_K_XL(约 17.5GB),权重得有一小半放 DDR4。DDR4 双通道有效带宽约 35-40GB/s,offload 部分每 token 都要过内存,实测量级大约 8-15 tok/s——比"乌龟"强一点,但长文本纠错/分析这种要读大量上下文的场景会等得很难受。不是不能跑,是体验问题。
-
加第二张 16G 卡:最划算的路子,值得。32G 显存把 Q4 权重全放下(16.5-17.5GB)+ KV 富余,速度直接跳到 35-50 tok/s 量级(论坛实测:双 3060 24G 43-50、双 5060Ti 65;4060Ti 比 5060Ti 慢一档)。PCIe 3.0 x4 带宽约 4GB/s 够不够:tensor split 每 token 跨卡传的激活量只有几百 KB,x4 损失个位数百分比,27B 这个规模完全没问题。同型号卡用 tensor split(-ts 1,1),异构才考虑 layer split——TID:1350 有实测。
-
量化与参数:
- Q4_K_M 和 UD-Q4_K_XL 都行,UD 版对敏感张量保更高精度,纠错这类吃细节的任务推荐 UD-Q4_K_XL,体积大不了多少。
- MTP:Qwen3.8-27B 的 MTP draft head 偏弱,接受率实测只有约 40%(TID:1350),双卡 tensor split 下跨卡同步开销还会吃掉收益——建议先关掉跑基线,想试就从 spec-draft-n-max 1 起步,2 大概率是负优化。terry 也说过多会话时投机解码收益很小。
- 64K 上下文 + KV 量化:恰恰相反,64K 时 KV 是大头,更该开量化。Qwen3.8-27B 是 GQA-4,q8_0 KV 实测约 37KB/token(TID:1350 David Chen 生产数据),64K 约 2.4GB,双卡 32G 完全没压力。Q8 KV 长上下文质量损失可忽略,放心开。
-
-
只换显卡的话 还是 7900XTX 24G 。速度提升最快。
考虑后续开发建议 R9700 32G。 -
只换显卡的话 还是 7900XTX 24G 。速度提升最快。
考虑后续开发建议 R9700 32G。 -
@asd2667 试了一下,现在是不能开mtp的……速度太慢了……Found it. The truth:
- Warm TTFT is actually fine: your unique 37-token prompt just processed at 29.6 tok/s (1.25s).
- The 2.5 tok/s you hit was the first request after the restart — one-time CUDA-graph + MTP draft compilation. That's a cold-start cost, not steady-state.
But I also found MTP is hurting, not helping on this 16GB setup: - Decode: 12.8 tok/s with MTP vs 18.9 tok/s without it earlier (the draft compute overhead exceeds the speculative gain at these speeds; draft acceptance mean was only ~2.3).
- MTP adds the cold-start compile overhead you felt.
So per the official page, MTP was meant for the bigger M-model on larger VRAM. On your XS-Pro/16GB it's net-negative. I'll disable MTP, keep the rest of the recommended config (q8/q4 KV, flash-attn, 64k, checkpoints, sampling), and pre-warm so you never hit the cold start:
-
,J johnnybegood 引用了 此主题