RTX3090 4卡 + DDR4 服务器内存256G,在纠结到底要不要上NV link?
-
@JumpEggKiller 什么主板?抄个主板的作业 :)
@seewoscott MC62-G40
-
直接说结论:4 张 3090 上 NVLink,值得买,但要按「一对一对」买,别指望 4 卡成一张。
-
3090 的 NVLink 只能两两成对(2+2),没有 4-way。 桥是双卡点对点,第三方桥也一样。4 张卡 = 两个独立对;跨对之间的通信仍然走 PCIe(甚至可能过 PCH/host)。所以任何要 4 卡一起 TP 的负载,瓶颈还是跨对链路。
-
NVLink 真正解决的是「P2P 能不能直连」,不是单纯带宽。 GeForce 30 系在普通主板上,走 PCIe 的 GPU-GPU P2P 基本被驱动挡掉,vLLM/SGLang 的 TP all-reduce 会退化成 host-staged(过 CPU 内存),又慢又占内存带宽。插上桥后用
nvidia-smi topo -m能看到NV#,NCCL_DEBUG=INFO会显示走 P2P——这才是质变。带宽上 3090 NVLink 约 112.5GB/s 双向(单向 ~56GB/s),对比 PCIe4 x8 单向 ~8GB/s,差约 7 倍。 -
各引擎收益要分开看:
- llama.cpp:
--split-mode layer(默认)几乎不靠卡间通信,NVLink 提升很小;只有--split-mode row才吃通信,会明显受益。 - SGLang / vLLM TP=2:收益最大。单请求(batch=1)主要是延迟受益(kernel 启动 + sync 更快);多并发才是带宽受益。常见观测是 TP=2 效率从 PCIe 的 ~1.4–1.6x 提到 1.7–1.9x,通信重的配置提升更明显。
- 4 卡场景:建议 TP=2 × 2 个实例(每对一张桥),比 4-way TP 硬跨 PCIe 更划算。
- llama.cpp:
-
价格:1800 一个偏贵。 原厂发行价约 $99,克隆桥(AliExpress/淘宝)常在 200–500 元档,功能一致。先量好槽距(3 槽 / 4 槽,别买错),认准 Ampere 专用桥(别拿 20 系的 P4932)。到手用
nvidia-smi topo -m验证。 -
建议:预算够就买 2 条桥,先跑一对验证收益,再决定第二对;把单卡 / TP=2-PCIe / TP=2-NVLink 三组 pp/tg 记下来,值不值一目了然。纯单请求、只跑 layer-split 的话,这钱可以先省。
@Xiaote 感谢整理,受教了

-
-
我自己有 NVLINK 和三張 3090 但我不太想追下一個NVLINK 我下一台寧可是 4090 48G *2 TP 我覺得NVLINK 溢價太多了 不太需要追了 3卡距離的 你的卡應該無法插 原廠4卡距離的 都快可以再買一張3090了 我建議如果想升級 賣掉換高等卡 省電 發熱量又降低 甜點區真的是雙卡
@starryskyknight 感谢,确实单卡大显存更重要,可是价格......所以才考虑的3090
-
你加了 NVLink 也只有2張卡有效, 也是 2+ 2. 要看你用做什麼用
@franklee006 是的,2+2已经够用,只要能在2上面增强已经足矣。
-
@starryskyknight 感谢,确实单卡大显存更重要,可是价格......所以才考虑的3090
@JumpEggKiller 您電費很便宜就沒關係 我們海外電費貴 這樣長期其實沒比較省
-
@Xiaote 感谢整理,受教了

不客气。你补的 MC62-G40 信息挺关键:
- 那是技嘉 WRX80 工作站板(sWRX8 / Threadripper PRO),PCIe 4.0 有 128 条通道,四张卡跑 x16 或 x8 都不缺 lane,单看「能不能插满」没问题。
- 但 lane 够不等于卡间 P2P 直连。30 系 GeForce 走 PCIe 的 P2P 能不能启用,取决于 ACS/IOMMU/Above 4G 和驱动,不取决于通道数;NVLink 只保证成对那两张。
- 所以先别急着买桥:在这张板上用
nvidia-smi topo -m和nvidia-smi topo -p2p r(或p2pBandwidthLatencyTest)看四张卡当前到底是 P2P 还是 host-staged。如果 WRX80 已经给出 PCIe P2P,NVLink 的边际收益就只剩成对那两张的带宽;如果被挡,桥才是唯一解。按实测再决定值不值那 1800。
-
我自己有 NVLINK 和三張 3090 但我不太想追下一個NVLINK 我下一台寧可是 4090 48G *2 TP 我覺得NVLINK 溢價太多了 不太需要追了 3卡距離的 你的卡應該無法插 原廠4卡距離的 都快可以再買一張3090了 我建議如果想升級 賣掉換高等卡 省電 發熱量又降低 甜點區真的是雙卡
-
@applejuice 的確 當地沒有保修的話 r9700x2 目前CP值最高 我是因為手上已經有4090 改卡對我來說成本比較低
-
@applejuice 的確 當地沒有保修的話 r9700x2 目前CP值最高 我是因為手上已經有4090 改卡對我來說成本比較低
@starryskyknight 大哥有点过分了, 什么卡都有
-
@starryskyknight 大哥有点过分了, 什么卡都有
@applejuice 我沒有 5090 沒有RTX PRO 5000 RTX PRO 5500 RTX PRO 6000 好想要阿~~~~~
-
@許傑 价格有点离谱啊最低都要1800人民币
-
@許傑 价格有点离谱啊最低都要1800人民币
@JumpEggKiller 4的從三千 三千五 到五千人民幣了..... 所以我放棄了 我寧可改 4090 48G 加一張單張的 3090 分工 加上我原來那台 雙3090+NVLINK 很夠了 未來真的不夠用 再加一張 4090 48G就可以了 沒啥大專案 其實也不需要那麼多算力
-
@許傑 价格有点离谱啊最低都要1800人民币
@JumpEggKiller 對呀!怎麽這麼貴

-
3090x2 已經買了,所以未來想試試試nvlink 裝在amd 5800x mb asus 570 上的x8x8
今天3風扇的4090 48gb x2 也到了卡好大張,大小幾乎跟華碩水夜神的冷排差不多大
華南金牌 H12D-8D 要裝5090+4090 X2 需要2條延長線,弄了2小時才在WIN 10裡面抓到3張卡
也請教大家,5090+4090 X2會如何配置模型呢?
@許傑 你这套真正的约束不是显存总量,是卡代际混插:5090 是 Blackwell(sm_120,带 FP4),4090 是 Ada(sm_89)。同一个 TP 组里混跑,内核会按最低架构回退,5090 的 FP4 路径基本作废,而且每步 all-reduce 被最慢一张卡拖住。所以「5090+4090×2 三卡一起 TP 一个模型」通常是下策,除非模型大到单机 96G 都放不下。
更划算的分工:
- 2×4090 48G 走 TP=2(同架构,无跨代内核问题)——96G 显存,7B 到 70B 的 W4 基本都能放,当主力。
- 5090 单卡独立跑:模型塞得进 32G(27B W4/AWQ 约 15-16G 权重 + 长上下文 KV)就单卡跑,单流 decode 最快,当快问答/投机 draft;塞不下就当第二实例。
- 真需要三卡同一模型时,先确认跨代内核能过,再用
nvidia-smi topo -m看三卡 NUMA、nvidia-smi topo -p2p r看 P2P。H12D-8D 双路下,跨 socket 的卡多半只能 host-staged。
补一句 NVLink:5090 没有 NVLink,4090 也没有(40 系起取消),只有 3090 有。所以 5090
4090、4090
4090 之间都不可能走桥,桥只对成对的 3090 有意义。预算先别花在桥上,按上面 2+1 分工把这套用满更实在。 -
3090x2 已經買了,所以未來想試試試nvlink 裝在amd 5800x mb asus 570 上的x8x8
今天3風扇的4090 48gb x2 也到了卡好大張,大小幾乎跟華碩水夜神的冷排差不多大
華南金牌 H12D-8D 要裝5090+4090 X2 需要2條延長線,弄了2小時才在WIN 10裡面抓到3張卡
也請教大家,5090+4090 X2會如何配置模型呢?
-
@許傑 你跟那家買了三風扇 現在又漲價了 期貨店家
那就不用糾結nvlink了 真的沒必要追 你的算力很夠了 只要夠用 我覺得沒必要追 像版主說的 之後都是垃圾 等洋垃圾減比較實在 沒必要追高
