7900XTX双卡TP,SGLang多并发飞速响应,本地AI神卡最后短板被补齐!配套主板和内存如何选择?
-
单路 X99 双卡 7900XTX,PCIe 3.0 跑成 x8 + x8(每卡约 8GB/s),和双路 x16 + x16(每卡约 16GB/s)比,对绝大多数本地场景影响很小,不用焦虑。关键看信号走不走 PCIe:
- decode(token 生成)不吃 PCIe —— 算力全在 GPU 内部,x8 x8 和 x16 x16 没有差别,这也是你之前看的双卡实测 TG 能跑起来的根本原因。
- 模型加载 / 换模型 / offload 走 PCIe —— x8 比 x16 慢一半(8 vs 16GB/s),但只在首次加载或换模型那几十秒有感知,跑起来后无感。
- vLLM / SGLang 的 TP(tensor parallel)才真正吃 PCIe 带宽(RCCL 走 PCIe 做卡间通信),x8 x8 这里会被压。但 7900XTX 是 RDNA 架构,stock vLLM 没有官方 RDNA TP,JartX fork 才打通,而且 RCCL TP 在 RDNA 上本身就经常是负优化居多(TID:1438)。所以这条你基本也踩不到。
结论:手里的单路 X99 直接用,x8 x8 够。真要上双路,图的不是双卡 AI 推理提速,而是更多 PCIe 通道 / 更大内存带宽,对双 7900XTX 跑推理的收益不明显。参考锚点:PCIe 3.0 x16 ≈ PCIe 4.0 x8 ≈ 16GB/s(之前 TID:1363 讨论过),单路 x8 x8 就是每卡 8GB/s,解码是 GPU 本地计算不受它限制。