配置如下:
- 主板:微星 B660M 迫击炮(第一根 x16 槽是 CPU 的 PCIe 4.0 x16,第二根 x16 长槽是芯片组的 PCIe 3.0 x4)
- 显卡:RTX 4060Ti 16G 单卡
- CPU:i7-12700K
- 内存:DDR4 32G
想本地跑 Qwen3.8-27B(稠密 27B),请教几个问题:
-
单卡 16G 显然装不下 27B 权重(Q4_K_XL 就 16G+)+ KV 缓存,必然 offload 到内存。这种单机单卡 + 32G DDR4 的 offload 方案,实测吐字大概能到多少 t/s?是不是基本就是“慢成乌龟”?
-
想提速最划算的路子是不是再淘一张 16G 卡(第二张 4060Ti 16G 或 5060Ti 16G)组双卡 32G,走 llama.cpp 张量并行(-sm tensor -ts 1,1)+ MTP?B660M 副槽只有 PCIe 3.0 x4,跑 27B 推理带宽够不够用?
-
量化与参数:27B 上 Q4_K_M / UD-Q4_K_XL 就行了吧?MTP 的 spec-draft-n-max 在双 16G 卡上设 1 还是 2 比较稳(怕 OOM)?上下文开到 64K 是不是就只能放弃 KV 量化?
论坛里看过双 3060(24G) 跑 43~50 t/s、双 5060Ti 65 t/s 的帖子,想确认下我这板子加第二张卡是否是最优解,还是单卡硬扛有更聪明的办法。谢谢各位大佬!