DDR4 服务器内存256G + RTX 3090 双卡 应该升级怎样的平台?
-
為什麼沒考慮到 AMD Ryzen Threadripper PRO 3945WX + WRX80E
滿血 PCIE 4 x 16 x 7,而且可以沿用非 ECC DDR4 加上八通道,拿來當 HiCache 用非常完美呀
我的 3090 x 4 (SGLang TP=2x2) 用起來很完美 -
现在市场价格好。多余的卖了就行。
刚谈了双卡AMD。R9700 32G 双卡可以的。
怎么折腾都够用。 -
一旦 硬件市场 跌了 捏一堆 二手内存很闹心。
回顾下 曹操的。食之无味弃之可惜。 -
人生苦短, 哪怕开心几天也是赚了。
-
目前和GLM FLASH聊了快一天了, 这是最终草稿,请各位大神指正。
一、功耗账(先算再买)
━━━━━━━━━━━━━━━━━━━━━━部件 满载 7B13(cTDP 225-280W) ~240W 4×3090(限功率 250-280W/卡) 1000-1120W 内存 16 条 + 风扇 + 硬盘 + 主板 ~100W 峰值合计 ~1350-1450W 电源黄金法则:负载控制在额定 60-80%(效率曲线甜点 + 瞬态余量)→ 额定 1800W 是及格线,2000W 是舒适线。3090 有毫秒级 2 倍瞬时尖峰(我们 DL380 调研时领教过 550W+ 瞬态),冗余必须留足。
━━━━━━━━━━━━━━━━━━━━━━
二、电源选型(三档)
━━━━━━━━━━━━━━━━━━━━━━首选:海韵 PRIME PX-2000W(钛金)约 ¥3500-4000
- 2000W 单路 +12V,原生态 12×8pin PCI-e(不用转接线),10 年保
- 3090 瞬态尖峰最怕组电压跌,钛金纹波控制最稳
性价比:振华 LEADEX III ATX 2000W(金牌)约 ¥2200-2500
- 2000W,8-10 组 PCI-e,7 年保,3090 社区常用款
_budget:长城巨龙 GTN 2000W(金牌)约 ¥1500-1800
- 国产老大,keinsci 那位 7K62 老哥同款系列,够用,接口数确认 ≥10 组 8pin
️ 关键验收点(买前问一句):原生 8pin PCI-e 接口 ≥8 组。4×3090 = 8 条独立供电线,严禁一分二(单线带 300W 是 3090 红线)。接口不够的要加 PCIe 转 2×8pin 的正规显卡线,不要用电源附赠的杂牌线。避开:任何 1600W 以下(4 卡 + 7B13 顶着上限跑)、服务器冗余电源(CRPS 需要配转接板 + 分线器,噪音大,DIY 塔式不值得折腾)。
━━━━━━━━━━━━━━━━━━━━━━
三、机箱选型
━━━━━━━━━━━━━━━━━━━━━━硬性需求:EEB 兼容(MZ32-AR0 是 305×330mm,比 E-ATX 305×277 还深)+ 9 个以上 PCI 扩展位(7 条 x16 槽 + 风扇位)+ 4 卡限长 ≥340mm。
首选:追风者 Enthoo 719(约 ¥800)
- 8+3 扩展位,支持 SSI-EEB(355×335mm 板都装得下)
- 4×3.5“ + 11×2.5” 盘位(16 条内存旁边还能塞大容量硬盘)
- 风扇位充足(前 4 + 顶 3 + 后 1),4×3090 开放式散热卡风道无忧
- Reddit 4×3090 实战背书(ROMED8-2T 社区标配机箱)
- 唯一注意:719 官方标称支持 SSI-EEB,但 MZ32-AR0 的 330mm 深度接近上限——下单前问一句客服“能装 305×330mm 的 EEB 板吗”,或者直接买 MZ32-AR0 前先确认这板的具体长宽
备选:安钛克 P101(约 ¥700)
- 同级 EEB 兼容,静音棉版,风道略逊 719 但更安静
- 盘位 8×3.5 + 3×2.5
━━━━━━━━━━━━━━━━━━━━━━
四、最终清单(含电源机箱)
━━━━━━━━━━━━━━━━━━━━━━# 配件 型号 价格 1 主板 MZ32-AR0(一年保) ¥2300 2 CPU EPYC 7B13 64 核 128 线程的 Zen3 ¥3898 256MB L3缓存 基频约 2.2GHz。 全核睿频约 3.25GHz。 单核睿频最高可达 3.5-4.1GHz|3 | 机箱 | 追风者 Enthoo 719 | ~¥800 |
| 4 | 电源 | 振华 LEADEX III 2000W 金牌 | ~¥2300 |
| 5 | 散热 | SP3 塔式(利民/猫头鹰) | ~¥300 |
| | 合计 | | ~¥9600 |比原预算(¥8000)超了约 ¥1600——主要是 7B13 比 7B12 贵的那部分。如果总预算要压回 ¥8000,电源降到长城巨龙 2000W(省 ¥700)即可,性能零影响。
最后下单前唯一必问:MZ32-AR0 Rev 3.x + BIOS 认 7003(7B13)。这颗定了,机器就能转起来。
-
目前和GLM FLASH聊了快一天了, 这是最终草稿,请各位大神指正。
一、功耗账(先算再买)
━━━━━━━━━━━━━━━━━━━━━━部件 满载 7B13(cTDP 225-280W) ~240W 4×3090(限功率 250-280W/卡) 1000-1120W 内存 16 条 + 风扇 + 硬盘 + 主板 ~100W 峰值合计 ~1350-1450W 电源黄金法则:负载控制在额定 60-80%(效率曲线甜点 + 瞬态余量)→ 额定 1800W 是及格线,2000W 是舒适线。3090 有毫秒级 2 倍瞬时尖峰(我们 DL380 调研时领教过 550W+ 瞬态),冗余必须留足。
━━━━━━━━━━━━━━━━━━━━━━
二、电源选型(三档)
━━━━━━━━━━━━━━━━━━━━━━首选:海韵 PRIME PX-2000W(钛金)约 ¥3500-4000
- 2000W 单路 +12V,原生态 12×8pin PCI-e(不用转接线),10 年保
- 3090 瞬态尖峰最怕组电压跌,钛金纹波控制最稳
性价比:振华 LEADEX III ATX 2000W(金牌)约 ¥2200-2500
- 2000W,8-10 组 PCI-e,7 年保,3090 社区常用款
_budget:长城巨龙 GTN 2000W(金牌)约 ¥1500-1800
- 国产老大,keinsci 那位 7K62 老哥同款系列,够用,接口数确认 ≥10 组 8pin
️ 关键验收点(买前问一句):原生 8pin PCI-e 接口 ≥8 组。4×3090 = 8 条独立供电线,严禁一分二(单线带 300W 是 3090 红线)。接口不够的要加 PCIe 转 2×8pin 的正规显卡线,不要用电源附赠的杂牌线。避开:任何 1600W 以下(4 卡 + 7B13 顶着上限跑)、服务器冗余电源(CRPS 需要配转接板 + 分线器,噪音大,DIY 塔式不值得折腾)。
━━━━━━━━━━━━━━━━━━━━━━
三、机箱选型
━━━━━━━━━━━━━━━━━━━━━━硬性需求:EEB 兼容(MZ32-AR0 是 305×330mm,比 E-ATX 305×277 还深)+ 9 个以上 PCI 扩展位(7 条 x16 槽 + 风扇位)+ 4 卡限长 ≥340mm。
首选:追风者 Enthoo 719(约 ¥800)
- 8+3 扩展位,支持 SSI-EEB(355×335mm 板都装得下)
- 4×3.5“ + 11×2.5” 盘位(16 条内存旁边还能塞大容量硬盘)
- 风扇位充足(前 4 + 顶 3 + 后 1),4×3090 开放式散热卡风道无忧
- Reddit 4×3090 实战背书(ROMED8-2T 社区标配机箱)
- 唯一注意:719 官方标称支持 SSI-EEB,但 MZ32-AR0 的 330mm 深度接近上限——下单前问一句客服“能装 305×330mm 的 EEB 板吗”,或者直接买 MZ32-AR0 前先确认这板的具体长宽
备选:安钛克 P101(约 ¥700)
- 同级 EEB 兼容,静音棉版,风道略逊 719 但更安静
- 盘位 8×3.5 + 3×2.5
━━━━━━━━━━━━━━━━━━━━━━
四、最终清单(含电源机箱)
━━━━━━━━━━━━━━━━━━━━━━# 配件 型号 价格 1 主板 MZ32-AR0(一年保) ¥2300 2 CPU EPYC 7B13 64 核 128 线程的 Zen3 ¥3898 256MB L3缓存 基频约 2.2GHz。 全核睿频约 3.25GHz。 单核睿频最高可达 3.5-4.1GHz|3 | 机箱 | 追风者 Enthoo 719 | ~¥800 |
| 4 | 电源 | 振华 LEADEX III 2000W 金牌 | ~¥2300 |
| 5 | 散热 | SP3 塔式(利民/猫头鹰) | ~¥300 |
| | 合计 | | ~¥9600 |比原预算(¥8000)超了约 ¥1600——主要是 7B13 比 7B12 贵的那部分。如果总预算要压回 ¥8000,电源降到长城巨龙 2000W(省 ¥700)即可,性能零影响。
最后下单前唯一必问:MZ32-AR0 Rev 3.x + BIOS 认 7003(7B13)。这颗定了,机器就能转起来。
-
我把“4×3090 场景下到底谁吃谁”的逻辑链钉死:
━━━━━━━━━━━━━━━━━━━━━━
为什么 ROMED16-2T + 2×7K62 在你的场景必输
━━━━━━━━━━━━━━━━━━━━━━① GPU 拓扑:4 卡 TP 的命门,双路先输一半
4×3090 张量并行 = 每层 2 次 allreduce,卡间通信密度极高。ROMED16-2T 的槽位分布是 Slot1/3/5 挂 CPU0,Slot4 挂 CPU1——4 张卡插满必然 2 卡在 CPU0、2 卡在 CPU1,6 对卡间通信里 4 对要跨 socket 走 xGMI 链路(延迟更高、带宽更低)。MZ32-AR0 是 4 卡全部直连同一颗 CPU 的根复合体,6 对通信全部同 NUMA 均匀无跨片。TP=4 的 decode 稳定性和 allreduce 延迟,单路拓扑结构性占优。
② 内存带宽优势是纸面的
双 7K62 聚合 273 GB/s 看着唬人,但三个折扣连环打:
- 6CCD vs 8 通道的错配是每颗 U 各自存在的,双路不会互相治愈——keinsci 那个 220 vs 300 GB/s 的实测就是双路 7K62 的真实成绩
- 打完折的 ~220 GB/s 要软件真正跨 NUMA 扩展才能吃到;llama.cpp/vLLM 的 NUMA 绑定是“能用但要调”,跨域访存一多反而比单路还慢
- 你的主力负载(27B 级 dense 全驻 96GB 显存)decode 阶段根本不碰内存带宽——显卡自己读显存。带宽优势只对将来的 MoE 卸载有意义,而那是你 96GB 显存装不下之后的次级需求
③ 账面:多花 ¥1600+ 买劣势
MZ32-AR0 + 7B13 ROMED16-2T + 2×7K62 板 + U ¥6200 ¥7800-8800 散热 1 套 ~¥850 2 套 ~¥1700 待机功耗 ~90W ~150-180W(常年开机一年多花 ~¥300 电费) 4 卡 Gen4 x16 ✓ 全部同 NUMA ✓ 但跨双 socket 故障面 单 CPU 双 CPU + NUMA 调优 总价反超 ¥1500-2500,换来的是 GPU 拓扑变差 + 单核性能降一代(Zen2 vs Zen3)+ 复杂度翻倍。96 核 vs 64 核是你唯一真赢的维度——但 4 卡推理主机里 CPU 核数在 64 之后就是富余,不是生产力。
━━━━━━━━━━━━━━━━━━━━━━
结论
━━━━━━━━━━━━━━━━━━━━━━确定。4×3090 场景下 MZ32-AR0 + 7B13 全面占优,没有悬念。 双路的唯一翻盘场景是“多租户虚拟化,按 socket 拆成两台独立机器租出去”——那不是你的需求。
️ Hindsight — saving to memory…
这套 ¥9450 不用再验证了,它就是终点站。四单拍完,等货。 @xiaote -
感觉楼主除非要搞那种非法的或成人的内容,不然不如用线上的AI吧,电费都要贵死
-
结论我同意:你这个负载(4×3090、27B dense 全驻显存)选 MZ32-AR0 + 7B13 单路是对的。但把机理说准,免得以后调优走错方向。
1)真正的分水岭不是内存带宽,是跨 socket 的 GPU P2P 能不能直连。Rome 双路下,分属两个 root complex 的 3090,PCIe P2P 常常被 ACS/IOMMU 挡掉、或根本没通,NCCL/SGLang 会退化成 host-staged(写 sysmem 再读回)或 SHM——这是模式切换,不是「延迟高一点」。所以单路把 4 卡放进同一个 root complex 是结构性占优,你的判断成立。验收别只看 xGMI 理论带宽:nvidia-smi topo -m / topo -p2p r 全 OK,且 NCCL_DEBUG=INFO 里是 P2P/SHM 而不是 SYS,才算真同 NUMA。
2)4×3090 更大的杠杆是 NVLink 成对,不是主板。两对桥接后对内 allreduce 走 112 GB/s、完全不碰 PCIe;板子只要保证「每对相邻、槽距够 3/4 槽桥、4 卡同 root complex」。所以预算优先蹲桥;桥拿不到就退回 TP=2×2 两个独立对,比硬上 TP=4 走 PCIe 划算。
3)内存带宽那条要分清:dense 全驻显存时 decode 确实不碰系统内存,双路 273 GB/s 是纸面优势没错;但将来真要大 MoE 卸载,瓶颈也是「单路 8 通道 + NUMA 绑定」,双路只会把调优复杂度翻倍,不会救你。所以现在和将来结论一致。
4)下单前两个核对:7B13 是 OEM/散片,确认板子 BIOS/AGESA 支持 Milan;MZ32-AR0 的 Gen4 x16 槽位要确认 7B13 的 128 lane 够分、4 卡都能跑 x16。这两点过了,这套就是终点站。