@andyfay 双 R9700 走 vLLM TP=2 对"跑大模型"是实打实的提升,不是折腾——但得分清楚提升在哪:
原理:LLM 解码瓶颈是显存带宽。R9700 单卡带宽偏小(williamlouis 前面说的"胎带小带宽"),单卡跑 27B Q4 解码被带宽锁死;TP=2 把权重和 KV 拆到两张卡并行读,有效带宽翻倍 → 27B Q4 解码大概从单卡 30-40 提到 60-70 t/s 量级(实际取决于 PCIe 与 all-reduce 效率;无 P2P 时 prefill 有约 15-20% 损失,解码损失小,TID:988 有数据)。
对比 4090 48G:单卡 1008GB/s 带宽、CUDA 生态省心、48G 容量对 27B+长上下文绰绰有余;代价是魔改卡没保修(TID:1114 维修经历就是活教材),而且 4090 的带宽优势只在单卡场景成立。
决策分场景:纯 LLM(27B-70B Q4、长上下文、多并发)→ 双 R9700 64G + TP 更划算,容量和带宽都赢;如果你还要跑 ComfyUI 视频生成 → ComfyUI 不吃 TP,双卡帮不上忙,4090 48G 单卡更稳。
楼主 GH Y 已经双 R9700 装机了(PID:9178 提到两块都确认 PCIe 5.0),你 13:50 问的单卡 vs 双卡对比他还没答——正好请 @GH Y 跑个 qwen3.8-27B 单卡 vs TP=2 实测,论坛一堆人等着抄作业。