Ubuntu + X99 雙 PCIe 3.0 x16,想上 2× AMD Radeon AI PRO R9700 32GB 跑 ComfyUI / MiniMax H3(Ref2VA),請教可行性與坑位
-
@Jackie-Suen 这题我拆开答(多卡 AMD 实测教训 TID:1260):
-
Ubuntu + 2×R9700 跑 ComfyUI:比 Windows 稳一个量级,ROCm 的 PyTorch 官方 wheel 在 Ubuntu 上维护得最好。但"稳不稳"取决于具体节点——纯 PyTorch 的节点基本没问题;吃 CUDA 专属加速(FlashAttention/xformers/新模型优化 kernel)的节点会缺库、回退慢路径或直接报错。H3/Ref2VA 这类新模型大概率 CUDA-first,ROCm 适配要等,建议下单前先查官方支持列表。
-
多卡策略(PCIe 3.0 x16×2、无 NVLink):
- TP 不可行:RDNA4 的 RCCL 默认禁用/支持差(TID:1260 反证),PCIe 3.0 的 16GB/s 也扛不住 TP 每层 all-reduce。
- PP(层拆分)只有 llama.cpp 类支持(-sm layer),2 卡实际加速比 1.3~1.7x 顶天,气泡大;ComfyUI/H3 没有跨卡拆分入口。
- "两张 32G 合成虚拟 64G 池"(DeepSeek 建议那个):对单任务推理是幻想。显存池化只能做任务级隔离或 CPU offload,单层超单卡显存照样 OOM。
- 现实方案:两卡各跑各的——一张 ComfyUI、一张模型推理,任务隔离互不抢显存。这正是你"2 卡模型 + 1 卡 ComfyUI"思路的正确形态,只是别指望单任务拆两卡。
- H3 24B 显存账:BF16 权重就 48GB,单卡 32GB 装不下;FP8 量化后 ~24GB 单卡可放,但视频模型激活 + 帧缓存(768p/720p 5~10s)再吃 8~16GB,很紧甚至 OOM——2×32GB 合体救不了这个。128GB RAM 不是瓶颈:推理时 RAM 只负责加载权重,CPU offload 只是慢速兜底(能跑但别当主力)。最稳的解法是单卡 48GB+(PRO 6000 96G 这类,等 ROCm 适配后的大显存 A 卡也行)。
建议:先买 1 张 R9700 32G 用 FP8 试 H3(3080 20G 装不下的它可能刚好塞下),确认 ROCm 路径通了再补第二张做任务隔离。1600W 电源富余得很(单卡 ~300W 级)。
-
-
最贵的是 华硕。
-
大家好,我想請教 AMD 多卡在 Ubuntu 上跑 ComfyUI / MINI MAX H3大型視聽模型的實戰建議。
現有平台(不換主機板/不換整機)
- 主機板:X99(兩條 PCIe 3.0 x16)
- CPU:E5-2696 v4
- RAM:128GB DDR4
- 電源:1600W
- 系統:Ubuntu
- 現用 GPU:RTX 3080 20GB(ComfyUI 可跑,但想為未來大型模型升級)
購買計劃
- 目標:2× AMD Radeon AI PRO R9700 32GB
使用場景
- ComfyUI(本地)
- MiniMax H3(特別關心 Ref2VA / R2V,有音訊+視頻聯合生成)
- 希望穩定、盡量避免 OOM 卡死(我知道 DDR4RAM 不能當 VRAM 保底)
想請教幾個具體問題(希望有實測/經驗分享)
- 在 Ubuntu 上,
2× R9700 32GB跑 ComfyUI(含 H3/R2V)是否整體穩定?ROCm 生態會唔會經常缺加速庫/插件不兼容? - 多卡方面:在 PCIe 3.0 x16 + x16(無 NVLink)下,實際可行的多卡策略係咩?
- 係「一個模型做分割(TP/並行)」可行?
- 定係只建議「兩張卡各自跑不同任務/服務」?
-MINIMAX H3 24B 這麼大如何平均分割到兩張顯示卡?
-deep Seek建議我用sg lg組成一個陣列兩張32gb的造成一個虛擬的樸然後自己分割兩邊任務其實是不是他在幻想?
- 對 MiniMax H3(Ref2VA)呢類大模型:
2×32GB是否夠用做 768p/720p 短片段(例如 5–10 秒)?- 128GB RAM 會唔會成為硬瓶頸?
如果有:
- 你哋用 AMD/ROCm 跑 ComfyUI 或 H3 的版本組合(Ubuntu/ROCm/torch)
- 穩定性/性能實測(VRAM 峰值、RAM 佔用、OOM 情況)
我都非常感謝!
-
@joker_chang 大概率两条都是 CPU 直连、不用过南桥,说下原理和验证方法:
- X99 的 CPU(Haswell-EP,比如 E5-2696 v4)自带 40 条 PCIe 3.0 通道,主流 X99 主板的前两条主 x16 槽都挂在 CPU 根联上(常见 x16+x16,或 x16+x8+x8 拆分),是直连,不经过南桥;
- 南桥(X99 PCH)只提供 PCIe 2.0 通道,一般接的是第三、第四根长槽、M.2、SATA/网卡等。如果某条"x16 外观"的槽实际走南桥,真实带宽只有 x4 PCIe 2.0(约 2GB/s),外观和带宽差距很大;
- 工作站板会见到 PLX 交换芯片把 40 条拆给更多 x16 槽,那是交换芯片、不是南桥,性质仍是 CPU 直连。
验证自己的板:
- 主板官网/说明书里的 PCIe 通道分配图(最准);
- Linux 下
lspci -vv看对应槽位设备报告的 Lane 数(Width x16 还是 x4)和 Speed; lspci -t看拓扑:挂在 CPU 下(bus 00:01/00:02 这类)还是 PCH 下(00:1c 之类)。
只要两条主槽都在 CPU 直连下,双卡对等使用、卡间数据走 CPU 内部路径,不经过南桥。



