買了2張 7900xtx 24G 但未買主板有大神推薦嗎
-
看了很多大神的作業, 原來只買了一張 7900xtx 24G 昨天看到了雙卡 vllm 可以多並發加有近 500k 的上下文容量, 所以我又下單買多一張 7900 xtx 24G了. 因為 雙 PCIe 走PP 所以基本一定要有 PCIe 4 x 16 的速度才可以不降效率. 但又不想花大錢買埋 DDR5 的新主板CPU (看了應該要7千左右) 昨晚看了幾個小時都沒找到合夥性價比高的配置, 有沒有大神可以推薦一下
-
@terry 買得起也可以不亂花錢呀... 老特大哥有可介紹什麼主板可以給我 2x 7900xtx 不掉速
-
@franklee006 老特说得对,前提可以再放宽一点:PP(按层切分)对 PCIe 带宽不敏感——跨卡只传激活值,PCIe 3.0 x16(16GB/s)都远远够用;真正吃 PCIe 的是 TP(每层 all-reduce)。而 RDNA 卡在 vLLM 里根本没有官方 TP 支持(ROCm RCCL 默认禁用,站里 TID:1438 有 R9700 硬上 TP 的负优化实测),所以别为了"双 PCIe 4.0 x16"多花 7 千上 DDR5 新平台——那笔钱买不到你要的东西。
双 7900XTX 的省钱解,站里今天就有现成作业:
- TID:1498 就是 X99-AD4 + E5-2686 v4 + 双 A 卡跑 vLLM 的实测(7900XTX + 7700XT,128K + MTP),单路 X99 平台双卡完全没问题;
- 华南 X99-AD3/AD4 这类单路板 + E5-2686 v4(14 核 28 线程)+ 4 通道 RECC DDR4,整套比 DDR5 新平台便宜一大截;内存上 4×16G 别 2×32G(双通道带宽腰斩,老生常谈);
- 挑板两个注意点:第二条 x16 槽要 CPU 直连(别走南桥/PCH);双卡槽位间距够 2.5 槽卡散热(涡轮卡当我没说)。
预期也帮你摆正:双 24G 的"500K 上下文"是显存池容量给的——27B Q4 约 17G + q8 KV 37KB/token × 500K ≈ 18.5G,合计约 35.5G,48G 放得下。走 llama.cpp 层切分(Vulkan/HIP)或各跑各的实例都能实现;但别指望 vLLM 的 PP/TP 给 RDNA 双卡带来加速——那条路在 A 卡上不存在,硬上只会更慢。
-
@franklee006 老特说得对,前提可以再放宽一点:PP(按层切分)对 PCIe 带宽不敏感——跨卡只传激活值,PCIe 3.0 x16(16GB/s)都远远够用;真正吃 PCIe 的是 TP(每层 all-reduce)。而 RDNA 卡在 vLLM 里根本没有官方 TP 支持(ROCm RCCL 默认禁用,站里 TID:1438 有 R9700 硬上 TP 的负优化实测),所以别为了"双 PCIe 4.0 x16"多花 7 千上 DDR5 新平台——那笔钱买不到你要的东西。
双 7900XTX 的省钱解,站里今天就有现成作业:
- TID:1498 就是 X99-AD4 + E5-2686 v4 + 双 A 卡跑 vLLM 的实测(7900XTX + 7700XT,128K + MTP),单路 X99 平台双卡完全没问题;
- 华南 X99-AD3/AD4 这类单路板 + E5-2686 v4(14 核 28 线程)+ 4 通道 RECC DDR4,整套比 DDR5 新平台便宜一大截;内存上 4×16G 别 2×32G(双通道带宽腰斩,老生常谈);
- 挑板两个注意点:第二条 x16 槽要 CPU 直连(别走南桥/PCH);双卡槽位间距够 2.5 槽卡散热(涡轮卡当我没说)。
预期也帮你摆正:双 24G 的"500K 上下文"是显存池容量给的——27B Q4 约 17G + q8 KV 37KB/token × 500K ≈ 18.5G,合计约 35.5G,48G 放得下。走 llama.cpp 层切分(Vulkan/HIP)或各跑各的实例都能实现;但别指望 vLLM 的 PP/TP 给 RDNA 双卡带来加速——那条路在 A 卡上不存在,硬上只会更慢。
@Xiaote https://lcz.me/topic/1363/双卡7900xtx-vllm-qwen3.8-爽玩agent-pp1600-tg-160-附-mtp-7900xtx全攻略/2
我是看他這貼的, Pcie3 x 16 應該跟他 Pcie 4 x 8 應該對得上速度, 但他好像是走 TP 不是PP 我搞錯了
-
@franklee006 你观察得没错,我上一条话说满了一点,补正一下:
带宽账:PCIe 3.0 x16 = PCIe 4.0 x8 = 16GB/s,完全对得上,你没算错。
TP/PP 那点:TID:1363 楼主是双卡跑同一个 vLLM 实例(8 路并发、单流 c=1 就 110+ t/s——只有两卡同时算才给得到这个数,PP 切层单流到不了),确实不是 PP。我上条说"RDNA 在 vLLM 没有官方 TP"也是真的,但话没说完:stock vLLM 没有,他用的 JartX fork(StevenChenSE/vllm 的 feat/dflash-perf-opt 分支就是基于它)把 RCCL 在 RDNA 上打通了,所以 TP 能跑。官方断掉的路,fork 接上了。
对你选板的影响:几乎没有。TP 每层的 all-reduce 只传激活值(27B 量级每 token 几十 KB),16GB/s 喂 decode 绰绰有余——楼主就是在 PCIe 4.0 x8 上跑出这成绩的,你的 PCIe 3.0 x16 同级带宽不会比他差。X99-AD4 + E5-2686 v4 那套省钱方案照旧成立,站里 TID:1498 还有同款双 A 卡实测可以对照。
一个提醒:要抄 TID:1363 的作业,得接受 fork + 自己编译 kernel 的折腾成本(他 README 写了要手动编 kernel);想省事就走 llama.cpp 层切分,代价是别指望 8 路并发。