RTX3090 4卡 + DDR4 服务器内存256G,在纠结到底要不要上NV link?
-

NV link好贵,目前最低的价格都在1800左右一个,想知道有没有已经link了的朋友,在各种启动方式(SGLANG/vLLM/llama.cpp)上进步有多大?到底值不值得上?
PS:3090购买经历
我目前是2张影驰大将3090+2张微星超龙3090。其中1影驰大将3090+1微星超龙3090是本地当面收的二手,经过验证,温度,性能都正常,另外1影驰大将3090+1微星超龙3090来自闲鱼,可能是运气比较好,经过验证,温度,性能也都正常就正常签收了。 -

NV link好贵,目前最低的价格都在1800左右一个,想知道有没有已经link了的朋友,在各种启动方式(SGLANG/vLLM/llama.cpp)上进步有多大?到底值不值得上?
PS:3090购买经历
我目前是2张影驰大将3090+2张微星超龙3090。其中1影驰大将3090+1微星超龙3090是本地当面收的二手,经过验证,温度,性能都正常,另外1影驰大将3090+1微星超龙3090来自闲鱼,可能是运气比较好,经过验证,温度,性能也都正常就正常签收了。nvlink 如网友分享 的确差很多
https://lcz.me/post/15935
https://lcz.me/post/16022人人4卡 3090
但是这种机箱不合我胃口 -
你加了 NVLink 也只有2張卡有效, 也是 2+ 2. 要看你用做什麼用
-
nvlink 如网友分享 的确差很多
https://lcz.me/post/15935
https://lcz.me/post/16022人人4卡 3090
但是这种机箱不合我胃口@applejuice 感谢分享,我仔细看看
-
@applejuice 这个机箱基本就是矿架+一个大型猫笼,因为家里有猫所以不得不把工作站关进笼子里保护起来。
-

NV link好贵,目前最低的价格都在1800左右一个,想知道有没有已经link了的朋友,在各种启动方式(SGLANG/vLLM/llama.cpp)上进步有多大?到底值不值得上?
PS:3090购买经历
我目前是2张影驰大将3090+2张微星超龙3090。其中1影驰大将3090+1微星超龙3090是本地当面收的二手,经过验证,温度,性能都正常,另外1影驰大将3090+1微星超龙3090来自闲鱼,可能是运气比较好,经过验证,温度,性能也都正常就正常签收了。@JumpEggKiller 什么主板?抄个主板的作业 :)
-
直接说结论:4 张 3090 上 NVLink,值得买,但要按「一对一对」买,别指望 4 卡成一张。
-
3090 的 NVLink 只能两两成对(2+2),没有 4-way。 桥是双卡点对点,第三方桥也一样。4 张卡 = 两个独立对;跨对之间的通信仍然走 PCIe(甚至可能过 PCH/host)。所以任何要 4 卡一起 TP 的负载,瓶颈还是跨对链路。
-
NVLink 真正解决的是「P2P 能不能直连」,不是单纯带宽。 GeForce 30 系在普通主板上,走 PCIe 的 GPU-GPU P2P 基本被驱动挡掉,vLLM/SGLang 的 TP all-reduce 会退化成 host-staged(过 CPU 内存),又慢又占内存带宽。插上桥后用
nvidia-smi topo -m能看到NV#,NCCL_DEBUG=INFO会显示走 P2P——这才是质变。带宽上 3090 NVLink 约 112.5GB/s 双向(单向 ~56GB/s),对比 PCIe4 x8 单向 ~8GB/s,差约 7 倍。 -
各引擎收益要分开看:
- llama.cpp:
--split-mode layer(默认)几乎不靠卡间通信,NVLink 提升很小;只有--split-mode row才吃通信,会明显受益。 - SGLang / vLLM TP=2:收益最大。单请求(batch=1)主要是延迟受益(kernel 启动 + sync 更快);多并发才是带宽受益。常见观测是 TP=2 效率从 PCIe 的 ~1.4–1.6x 提到 1.7–1.9x,通信重的配置提升更明显。
- 4 卡场景:建议 TP=2 × 2 个实例(每对一张桥),比 4-way TP 硬跨 PCIe 更划算。
- llama.cpp:
-
价格:1800 一个偏贵。 原厂发行价约 $99,克隆桥(AliExpress/淘宝)常在 200–500 元档,功能一致。先量好槽距(3 槽 / 4 槽,别买错),认准 Ampere 专用桥(别拿 20 系的 P4932)。到手用
nvidia-smi topo -m验证。 -
建议:预算够就买 2 条桥,先跑一对验证收益,再决定第二对;把单卡 / TP=2-PCIe / TP=2-NVLink 三组 pp/tg 记下来,值不值一目了然。纯单请求、只跑 layer-split 的话,这钱可以先省。
-
-
我自己有 NVLINK 和三張 3090 但我不太想追下一個NVLINK 我下一台寧可是 4090 48G *2 TP 我覺得NVLINK 溢價太多了 不太需要追了 3卡距離的 你的卡應該無法插 原廠4卡距離的 都快可以再買一張3090了 我建議如果想升級 賣掉換高等卡 省電 發熱量又降低 甜點區真的是雙卡
-

NV link好贵,目前最低的价格都在1800左右一个,想知道有没有已经link了的朋友,在各种启动方式(SGLANG/vLLM/llama.cpp)上进步有多大?到底值不值得上?
PS:3090购买经历
我目前是2张影驰大将3090+2张微星超龙3090。其中1影驰大将3090+1微星超龙3090是本地当面收的二手,经过验证,温度,性能都正常,另外1影驰大将3090+1微星超龙3090来自闲鱼,可能是运气比较好,经过验证,温度,性能也都正常就正常签收了。@JumpEggKiller 什么主板? 主板给力的话不一定需要上 nvlink
-
@JumpEggKiller 什么主板?抄个主板的作业 :)
@seewoscott MC62-G40
-
直接说结论:4 张 3090 上 NVLink,值得买,但要按「一对一对」买,别指望 4 卡成一张。
-
3090 的 NVLink 只能两两成对(2+2),没有 4-way。 桥是双卡点对点,第三方桥也一样。4 张卡 = 两个独立对;跨对之间的通信仍然走 PCIe(甚至可能过 PCH/host)。所以任何要 4 卡一起 TP 的负载,瓶颈还是跨对链路。
-
NVLink 真正解决的是「P2P 能不能直连」,不是单纯带宽。 GeForce 30 系在普通主板上,走 PCIe 的 GPU-GPU P2P 基本被驱动挡掉,vLLM/SGLang 的 TP all-reduce 会退化成 host-staged(过 CPU 内存),又慢又占内存带宽。插上桥后用
nvidia-smi topo -m能看到NV#,NCCL_DEBUG=INFO会显示走 P2P——这才是质变。带宽上 3090 NVLink 约 112.5GB/s 双向(单向 ~56GB/s),对比 PCIe4 x8 单向 ~8GB/s,差约 7 倍。 -
各引擎收益要分开看:
- llama.cpp:
--split-mode layer(默认)几乎不靠卡间通信,NVLink 提升很小;只有--split-mode row才吃通信,会明显受益。 - SGLang / vLLM TP=2:收益最大。单请求(batch=1)主要是延迟受益(kernel 启动 + sync 更快);多并发才是带宽受益。常见观测是 TP=2 效率从 PCIe 的 ~1.4–1.6x 提到 1.7–1.9x,通信重的配置提升更明显。
- 4 卡场景:建议 TP=2 × 2 个实例(每对一张桥),比 4-way TP 硬跨 PCIe 更划算。
- llama.cpp:
-
价格:1800 一个偏贵。 原厂发行价约 $99,克隆桥(AliExpress/淘宝)常在 200–500 元档,功能一致。先量好槽距(3 槽 / 4 槽,别买错),认准 Ampere 专用桥(别拿 20 系的 P4932)。到手用
nvidia-smi topo -m验证。 -
建议:预算够就买 2 条桥,先跑一对验证收益,再决定第二对;把单卡 / TP=2-PCIe / TP=2-NVLink 三组 pp/tg 记下来,值不值一目了然。纯单请求、只跑 layer-split 的话,这钱可以先省。
@Xiaote 感谢整理,受教了

-
-
我自己有 NVLINK 和三張 3090 但我不太想追下一個NVLINK 我下一台寧可是 4090 48G *2 TP 我覺得NVLINK 溢價太多了 不太需要追了 3卡距離的 你的卡應該無法插 原廠4卡距離的 都快可以再買一張3090了 我建議如果想升級 賣掉換高等卡 省電 發熱量又降低 甜點區真的是雙卡
@starryskyknight 感谢,确实单卡大显存更重要,可是价格......所以才考虑的3090
-
你加了 NVLink 也只有2張卡有效, 也是 2+ 2. 要看你用做什麼用
@franklee006 是的,2+2已经够用,只要能在2上面增强已经足矣。
-
@starryskyknight 感谢,确实单卡大显存更重要,可是价格......所以才考虑的3090
@JumpEggKiller 您電費很便宜就沒關係 我們海外電費貴 這樣長期其實沒比較省
-
@Xiaote 感谢整理,受教了

不客气。你补的 MC62-G40 信息挺关键:
- 那是技嘉 WRX80 工作站板(sWRX8 / Threadripper PRO),PCIe 4.0 有 128 条通道,四张卡跑 x16 或 x8 都不缺 lane,单看「能不能插满」没问题。
- 但 lane 够不等于卡间 P2P 直连。30 系 GeForce 走 PCIe 的 P2P 能不能启用,取决于 ACS/IOMMU/Above 4G 和驱动,不取决于通道数;NVLink 只保证成对那两张。
- 所以先别急着买桥:在这张板上用
nvidia-smi topo -m和nvidia-smi topo -p2p r(或p2pBandwidthLatencyTest)看四张卡当前到底是 P2P 还是 host-staged。如果 WRX80 已经给出 PCIe P2P,NVLink 的边际收益就只剩成对那两张的带宽;如果被挡,桥才是唯一解。按实测再决定值不值那 1800。
-
我自己有 NVLINK 和三張 3090 但我不太想追下一個NVLINK 我下一台寧可是 4090 48G *2 TP 我覺得NVLINK 溢價太多了 不太需要追了 3卡距離的 你的卡應該無法插 原廠4卡距離的 都快可以再買一張3090了 我建議如果想升級 賣掉換高等卡 省電 發熱量又降低 甜點區真的是雙卡
-
@applejuice 的確 當地沒有保修的話 r9700x2 目前CP值最高 我是因為手上已經有4090 改卡對我來說成本比較低
-
@applejuice 的確 當地沒有保修的話 r9700x2 目前CP值最高 我是因為手上已經有4090 改卡對我來說成本比較低
@starryskyknight 大哥有点过分了, 什么卡都有
-
@starryskyknight 大哥有点过分了, 什么卡都有
@applejuice 我沒有 5090 沒有RTX PRO 5000 RTX PRO 5500 RTX PRO 6000 好想要阿~~~~~
