二张3090通过nvlink跑大模型,有人尝试过吗?
-
x99,ddr3-32g 2080ti22g+11g+nvlink, Qwen3.8 27B Q4_K_P、128K Q8 KV、embedded MTP
已启用 llama.cpp 的 NVLink P2P 直接交换模式。验证结果:
-
MTP 服务已重启,PID:114030
-
进程环境:GGML_CUDA_P2P=1
-
GPU0
GPU1 P2P 读写:均为 OK -
双卡显存占用:
- GPU0:7750 MiB
- GPU1:14524 MiB
-
Q8 KV、思考模式、MTP 推测解码及 1,2 分层比例保持不变
-
实际推理请求成功,约 38.7 token/s
-
-
两张nvlink我跑过,用的club-3090的vllm docker. 之前发过一片朋友圈如下:
双卡3090+nvlink,模型Qwen3.6-27B-autoround-int4。 kv cache fp8_e5m2, 上下文长度 262144 。采用 club-3090 的vllm运行参数和测试脚本 soak-test.sh, p50_decode_tps:61.34;p95_ttft_ms:4864 。


不过,最近用了 syv-ai/qwen38-27b-rtx3090 用一张3090也跑出了不错的速度(见我另一篇帖子。用的int4量化,上下文减到160k, 不支持并发。 不过一个人用的话够了)。
我觉得双卡3090跑qwen3.8-27b,最好的场景,应该是多人/Agent并发。 用SGLang的redix tree缓存,加上双卡nvlink高带宽, 再配合HiCache应该有不错的效果。等我有时间和需求时搞一下。
-
正面回答你的纠结:在你这套平台上,双 3090 是更优解,理由按重要度排:
-
平台白送。浪潮双路 E5-2630 v3 本来就是为多卡设计的:80 条 PCIe 3.0 lanes,双卡 x16 满速,供电和风道比家用机箱强。买 4090 48G 魔改等于把平台闲置,单卡插服务器里有点浪费。
-
显存能力相同。双 3090 层切/TP 后合计 48G,和 4090 48G 一样:27B 的 Q8(约 30G)、70B 的 Q4(约 40G)都装得下。
-
速度有实测参照。上面 davidwei0826 的数据(p50 61.34 t/s,int4 + 262K 上下文)就是双 3090+NVLink 在 vLLM TP 模式下的真实水平,多人/Agent 并发场景这正是甜点。注意 431 楼那个 27/39/10 t/s 是 260W 功率墙锁出来的,不是卡的真实上限,别被吓到;解锁后 SGLang 40+ 没问题。
-
原厂卡 vs 魔改卡。4090 48G 是后焊显存:核心体质、显存散热、无保修都是赌点,二手 3090 量大、价格透明、坏了换一张就行。
4090 48G 魔改只适合一种人:不想折腾 TP、就要单卡省事、预算够且接受无保修。另外两个提醒:
- 你这平台是 PCIe 3.0,4090 是 4.0 卡插上去带宽减半——对推理影响不大(权重常驻显存),但 prefill 传输会慢一点;3090 也一样,不过层切模式激活传输量小,无所谓。
- 有人说 4090+7900XTX 混搭是最优解,别信:CUDA 和 ROCm 是两套栈,vLLM 根本没法混跑,那是云玩家建议。
- 买 NVLink 桥记得选 3-slot 版本(3090 三槽厚,2-slot 桥装不上)。
-
-
可以參考我的貼文,最近我又優化 用DFlash2 133t/s(峰值 161) 我再更新上來
-
4090 +3090 最优解 (次优,4090+7900xtx) (最次2*3090 能用不好用。使用场景受限,但合理配置+折腾,也能爽玩。我准备上第二个3090 )
为什么?
2个4090 不合适太贵。