9070XT 还是 5060TI 选哪个用于本地27B UD-IQ4_XS .感谢
-
其实可以考虑一下二手7900XTX 24G,上llama.cpp速度很快,毕竟接近1t的显存宽带
-
两张都是 16G,而 27B IQ4_XS 权重就要 14–15G,留给 KV 的只剩 1G 上下——这才是你真正的瓶颈,先接受上下文大概只能开 8–16K。
速度:9070XT 显存带宽约 640GB/s,5060Ti 16G 约 448GB/s,纯 decode 9070XT 大约快 1.3–1.4 倍。
生态:5060Ti 是 CUDA,llama.cpp/vLLM 开箱即用;9070XT 走 ROCm(gfx1201),现在 llama.cpp/SGLang/vLLM 都能跑,但 ninfer、DFlash、部分 INT4/MTP kernel 还是 NVIDIA 优先,新玩法往往要等适配。结论:
- 想省心、照着论坛大多数 NVIDIA 教程抄作业 → 5060Ti;
- 愿意折腾 ROCm、只追 decode 速度 → 9070XT;
- 预算能再加一点的话,二手 3090 24G 对 27B 的体验会明显好一档,16G 跑 27B IQ4_XS 真的是极限压缩。
@Xiaote 我正在用着单张5060TI,就如你说的上下文是瓶颈。只能跑IQ3. 如果双张5060TI, 建议吗?
-
5060TI 最多只能到IQ3,
目前我自己在用 Qwen3.8-27B-GSQ-RCO-GGUF IQ3XXS , 上下文 131072 (KV都用Q4), 沒開MTP , 沒加mmproj。
開始可以30 T/S, 到後面上下文開始多會下跌多17-20 T/S ,deepseek harness做點小程式還過得去.
Q4會offload 只有 10 T/S以下。基本上完全不可用.
如果真的要玩AI 就考慮下特哥建議的 7900XTX 或者 3090 那些, 會舒服很多. -
双 5060 Ti 只加容量、不加带宽,速度上大概率不划算。
先算账:27B IQ3 权重约 11G,5060 Ti 16G 是 128-bit GDDR7、448GB/s,单卡 decode 天花板约 448/11 ≈ 40 t/s(你实测 30 起,楼上 Choi Daniel 也是 30 起,对得上)。双卡 TP=2 理想是约 2×,但:
- 5060 Ti 没有 NVLink,PCIe 5.0 只有 x8;消费级主板第二条 x16 槽多半走芯片组、甚至只有 x4。每层 all-reduce 都走 PCIe,通信会把收益吃掉,实测常见 1.2–1.5×,第二槽只有 x4 时甚至倒挂。
- 27B 这种体量用 layer split 更稳,先拿 llama.cpp
--split-mode layer跑 pp/tg 基线,别用 row。
双卡真正的价值在容量:32G 能上 IQ4(权重 14–15G),KV 用 Q4 可以开到 32–64K,这确实是单卡 16G 给不了的。所以看你的痛点:
- 只是「只能 IQ3 + 上下文太小」 → 双 5060 Ti 可行,容量会舒服很多,但别指望提速;
- 想要单卡省心又更快 → 一张 24G(二手 3090 / 7900XTX)更值;
- 下单前先量主板:第二条 x16 槽是不是 CPU 直连、能不能 x8/x8,装好后各跑一次
lspci -vv -s 0000:03:00.0 | grep -i Lnk,确认 LnkSta 是 x8 以上;只有 x4 就别上双卡。