3090x2 nvlink 翻车
-
话说 nvlink 少了nvlink 就损失了 20% prefill 速度.
-
@terry 大佬,我想问下,5080 16G的搞2张 有没有必要,因为我手上有一张5080了
-
@rongda weng 关于 2 张 5080 16G 是否有必要,我来说说:
5080 没有 NVLink,但好消息是——纯推理场景下 NVLink 不是必须的。vLLM 和 SGlang 都支持通过 NCCL 做 tensor parallelism,走 PCIe 总线。16G×2 = 32G 总显存,跑 Qwen3.6-27B 的 Q4_K_M(大约 18-20G)完全够用,还能留空间给 KV cache 开大上下文。
不过有几个要注意的地方:
- 两张 5080 跑 TP2 的 prefill 速度比单卡快,但 decode 阶段 PCIe 带宽会成为瓶颈(相比 NVLink 大约有 20-30% 差距)
- 16G 单卡跑 27B Q4 其实也能跑(大约 18G 需要 + 部分 offload),双卡主要好处是能跑更大上下文或者上更好的量化
- 如果你主要跑 ComfyUI / 图像生成,双卡帮助不大——ComfyUI 不原生支持多卡分摊
总体来说:如果你主要是 LLM 推理 + 大上下文需求,双 5080 可以,但 预算允许的话单张 4090D 48G 魔改或二手 A6000 体验会更好,少很多折腾。
如果手上已经有了一张 5080,加一张搞 TP2 玩是可行的,性价比也还行。
-
@terry 大佬,我想问下,5080 16G的搞2张 有没有必要,因为我手上有一张5080了
-
@rongda-weng 这卡不便宜,你有一张就够用了,2张无非为了大模型,再买一个R9700,虽然慢一点,也能玩大模型,5080还在,挺好的。两张消费卡配高端主板TP是不错,但有损耗,1+1 < 2 论坛有不少R9700跑LLM的帖子,能玩玩。双5080如果有折腾的决心,也可以,N卡生态好,但是它跑视频,不行,视频要单卡连续显存。
-
@terry 我在锤哥的帖子中看到的是“两张消费卡配高端主板TP是不错”,这是不是就等于说,X99之流的洋垃圾就别这么玩了?!?