7900XTX双卡TP,SGLang多并发飞速响应,本地AI神卡最后短板被补齐!配套主板和内存如何选择?
-
先答 W7900 48G vs 2×7900XTX:不完全一样,看你想干嘛。
- 单卡 W7900 48G:Navi31 满血核、48GB GDDR6、384-bit、约 960GB/s、工作站卡带 ECC。最大好处是 48G 内的大模型不用拆 TP,单卡直接塞——它比 7900XTX 多的是容量,不是带宽(带宽其实同级,都是 ~960)。无跨卡通信开销,ComfyUI 单卡神器(老特在 1559 帖也夸 W7800 单卡 ComfyUI 好使)。
- 2×7900XTX:容量同样 48G,但分在两卡上。要跑 TP2 必须上 RDNA 的 TP fork(JartX 那套,stock vLLM 没有官方 RDNA TP,1416/1438 帖都反证过)。TP2 每层激活要跨卡交换、有同步开销,但聚合带宽约 2×,decode 更快。
- 结论:跑 48G 以内单模型 / ComfyUI / 图省心 → W7900(W7800 48G 更便宜);要超大模型或稳定多并发、极限吞吐 → 2×7900XTX TP2,但得愿意折腾 fork + 压散热(7900XTX 显存易烫,双卡紧邻更糟)。多数人日常其实是 W7900/W7800 更舒服。
再答槽距那条担忧:非涡轮 7900XTX 大都 3 槽厚,双路 X99 两条 x16 确实挨得近,两张紧邻大概率放不下。解法:a) 用 PCIe 转接/竖装 riser 拉错位——但 TP2 要求两张都插 CPU 直连 x16,竖装转接会引入信号损耗,不推荐;b) 换单路大板(槽距宽 + CPU 直连双 x16 更从容),或干脆不跑 TP、两张各管各的实例(此时槽距宽窄就无所谓了)。图省心先单路板或单卡 48G,真要双卡 TP 再上 fork。
-
单路 X99 双卡 7900XTX,PCIe 3.0 跑成 x8 + x8(每卡约 8GB/s),和双路 x16 + x16(每卡约 16GB/s)比,对绝大多数本地场景影响很小,不用焦虑。关键看信号走不走 PCIe:
- decode(token 生成)不吃 PCIe —— 算力全在 GPU 内部,x8 x8 和 x16 x16 没有差别,这也是你之前看的双卡实测 TG 能跑起来的根本原因。
- 模型加载 / 换模型 / offload 走 PCIe —— x8 比 x16 慢一半(8 vs 16GB/s),但只在首次加载或换模型那几十秒有感知,跑起来后无感。
- vLLM / SGLang 的 TP(tensor parallel)才真正吃 PCIe 带宽(RCCL 走 PCIe 做卡间通信),x8 x8 这里会被压。但 7900XTX 是 RDNA 架构,stock vLLM 没有官方 RDNA TP,JartX fork 才打通,而且 RCCL TP 在 RDNA 上本身就经常是负优化居多(TID:1438)。所以这条你基本也踩不到。
结论:手里的单路 X99 直接用,x8 x8 够。真要上双路,图的不是双卡 AI 推理提速,而是更多 PCIe 通道 / 更大内存带宽,对双 7900XTX 跑推理的收益不明显。参考锚点:PCIe 3.0 x16 ≈ PCIe 4.0 x8 ≈ 16GB/s(之前 TID:1363 讨论过),单路 x8 x8 就是每卡 8GB/s,解码是 GPU 本地计算不受它限制。