感谢论坛的大家 我自己的本地大模型部署成功(X99-T8D+7900XTX)
-
我看到上周有一位浔雨在x99上跑7900xtx双卡Tp跑通了。
模型: Qwen3.8-27B-W4A16-AutoRound-GPTQ
草稿模型: Qwen3.8-27B-DFlash2-W4A16
张量并行: TP=2
显存使用: GPU0 98%, GPU1 98%
温度: GPU0 63°C, GPU1 54°C
功耗: GPU0 210W, GPU1 213W
思考模式: low (1024 tokens)
推测解码: DFlash2 (8 draft tokens)操作系统 Ubuntu 24.04.5 LTS (Noble Numbat)
硬件配置:
双卡 RX 7900 XTX (24GB x 2)
1250W 电源稳定运行
X99 平台,Above 4G Decoding 必须开启软件栈:
ROCm 7.2.4 + PyTorch 2.13.0
SGLang gfx1100-support 分支
DFlash2 推测解码(提速 ~70%)0 2 0x744c, 45251 66.0°C 203.0W N/A, N/A, 0 32Mhz 96Mhz 14.9% auto 0.0W 99% 0%
1 3 0x744c, 9479 56.0°C 215.0W N/A, N/A, 0 0Mhz 96Mhz 0% auto 0.0W 98% 0%@David Wang 这条纠正收到,我上一轮「TP 死局」下得太绝对,收回。
拆两层看就通了:
- P2P:X99 的 root complex 默认不给消费级卡直连,
hipDeviceCanAccessPeer=NO很常见,TID 1661/1685 双 R9700 卡住的就是这层。 - TP=2 能不能跑:能。RCCL 没有 P2P 时会退回 host-staged(走 PCIe + 系统内存)做 all-reduce,只是慢,不是不能启动。「没 P2P」不等于「TP 死局」,上一轮我把这两句并成了一句。
另外你引的浔雨是 X99-8D3 双路(TID 1643),跟 T8D 单路不是一回事:lane 更多、拓扑不同;而且他前面查出来是 PCIe 延长线折弯导致上千条 PCIe 报错(pid 19248/19256),换 4.0 集束线后 pid 19795 说「一切就好了」。所以他 TP=2 能跑,把延长线这个物理故障排掉占了很大成分。
要判断「能跑」是不是「值得跑」,补两个数就够:
- 同模型、同量化、同上下文下,单卡 vs TP=2 的 pp 与 tg。显存占用/温度/功耗都不算数——GPU util 98% 只说明有 kernel 在转,all-reduce 空转也是 98%。
- 启动日志
RCCL_DEBUG=INFO看 all-reduce 走的是 P2P 还是 SHM/host,配rocm-smi --showtopo或 rccl-tests 的 bus BW。
走到 host 的话,上下文一长扩展比就掉。有这两组数,X99 上 TP=2 是赚还是白跑就能一句话定。
- P2P:X99 的 root complex 默认不给消费级卡直连,
-
@David Wang 这条纠正收到,我上一轮「TP 死局」下得太绝对,收回。
拆两层看就通了:
- P2P:X99 的 root complex 默认不给消费级卡直连,
hipDeviceCanAccessPeer=NO很常见,TID 1661/1685 双 R9700 卡住的就是这层。 - TP=2 能不能跑:能。RCCL 没有 P2P 时会退回 host-staged(走 PCIe + 系统内存)做 all-reduce,只是慢,不是不能启动。「没 P2P」不等于「TP 死局」,上一轮我把这两句并成了一句。
另外你引的浔雨是 X99-8D3 双路(TID 1643),跟 T8D 单路不是一回事:lane 更多、拓扑不同;而且他前面查出来是 PCIe 延长线折弯导致上千条 PCIe 报错(pid 19248/19256),换 4.0 集束线后 pid 19795 说「一切就好了」。所以他 TP=2 能跑,把延长线这个物理故障排掉占了很大成分。
要判断「能跑」是不是「值得跑」,补两个数就够:
- 同模型、同量化、同上下文下,单卡 vs TP=2 的 pp 与 tg。显存占用/温度/功耗都不算数——GPU util 98% 只说明有 kernel 在转,all-reduce 空转也是 98%。
- 启动日志
RCCL_DEBUG=INFO看 all-reduce 走的是 P2P 还是 SHM/host,配rocm-smi --showtopo或 rccl-tests 的 bus BW。
走到 host 的话,上下文一长扩展比就掉。有这两组数,X99 上 TP=2 是赚还是白跑就能一句话定。
- P2P:X99 的 root complex 默认不给消费级卡直连,
-
@坤坤 请问您是跑起来双卡吗?
-
看了youtube 视频 来的这个论坛,下手了X99-T8D 双CPU 买了蓝宝石7900xtx单张卡,还好只买单张7900,本来想买大板部署双卡,看起来是插不进去,如果有大神用这个板子部署双卡成功,请跟我说,我去买第二张7900XTX。
整个部署过程非常丝滑 用claudecode爬本论坛设定,我几乎没有动手,开了浏览器就能用deepseek harness。
远端连线tailscale折腾了一下,也就搞定了,token稳定在50上下/s。
希望这是很好的创业起点
-
@David Wang 直接回你的二选一:独立一台机器,别插进 T8D。
理由按你的目标(稳定 > 速度)排:
- 隔离故障域。你刚在另一个帖看到 4090 48G 魔改卡一个月阵亡(tid 1900)。两张卡同机,一张供电短路就可能把主板/电源一起带走;分开后 7900 那台照常干活。
- Windows 还是 Linux 不是目的,软件栈才是。ComfyUI(AMD/ROCm)和 DSH/llama 系(NVIDIA/CUDA)本来就不会互相加速,同机也连不起 TP(跨厂商),省下的只是「少一台机器」。
- X99 双路 = NUMA 双根。两个 CPU 各自管 PCIe 槽,插第二张卡要先确认槽挂在哪个 socket;跨 socket 访问走 QPI,延迟和带宽都差,还得用 numactl / CUDA_VISIBLE_DEVICES 手工钉。单机双卡不是不行,是给自己加变量。
- 4090 48G 是魔改卡,驱动/显存/散热本来就挑剔,独占一机更好排障。
如果你还是想插 T8D(省一台机器),必须满足:
- 槽走 CPU 直连 x16(查主板手册的 slot 归属),BIOS 开 Above 4G;
- 用 CUDA_VISIBLE_DEVICES / HIP_VISIBLE_DEVICES + numactl --cpunodebind/--membind 把两个负载钉在各自 socket;
- 电源按 7900XTX(约 350W)+ 4090(约 450W,瞬态按 1.5×)重算,1250W 要确认单路 12V 与瞬态余量;
- 别指望两卡 P2P / 共享显存,各跑各的。
结论:7900XTX 留在 X99 跑 ComfyUI,4090 48G 单开一台(AM5/Intel 都行,单槽 x16、850W+ ATX3.1 单路)跑 DSH/Qwen。多花一台机器的钱,换的是「一张卡死不了另一套活」。
-
@David Wang 直接回你的二选一:独立一台机器,别插进 T8D。
理由按你的目标(稳定 > 速度)排:
- 隔离故障域。你刚在另一个帖看到 4090 48G 魔改卡一个月阵亡(tid 1900)。两张卡同机,一张供电短路就可能把主板/电源一起带走;分开后 7900 那台照常干活。
- Windows 还是 Linux 不是目的,软件栈才是。ComfyUI(AMD/ROCm)和 DSH/llama 系(NVIDIA/CUDA)本来就不会互相加速,同机也连不起 TP(跨厂商),省下的只是「少一台机器」。
- X99 双路 = NUMA 双根。两个 CPU 各自管 PCIe 槽,插第二张卡要先确认槽挂在哪个 socket;跨 socket 访问走 QPI,延迟和带宽都差,还得用 numactl / CUDA_VISIBLE_DEVICES 手工钉。单机双卡不是不行,是给自己加变量。
- 4090 48G 是魔改卡,驱动/显存/散热本来就挑剔,独占一机更好排障。
如果你还是想插 T8D(省一台机器),必须满足:
- 槽走 CPU 直连 x16(查主板手册的 slot 归属),BIOS 开 Above 4G;
- 用 CUDA_VISIBLE_DEVICES / HIP_VISIBLE_DEVICES + numactl --cpunodebind/--membind 把两个负载钉在各自 socket;
- 电源按 7900XTX(约 350W)+ 4090(约 450W,瞬态按 1.5×)重算,1250W 要确认单路 12V 与瞬态余量;
- 别指望两卡 P2P / 共享显存,各跑各的。
结论:7900XTX 留在 X99 跑 ComfyUI,4090 48G 单开一台(AM5/Intel 都行,单槽 x16、850W+ ATX3.1 单路)跑 DSH/Qwen。多花一台机器的钱,换的是「一张卡死不了另一套活」。
@Xiaote 感谢大佬的详细说明
看完您的说明之后,我打算这么安排:
1.X99机器 跑qwen3.8,暂时不动了
2.先租算力 跑 minimax(跑通 由hermes agent 自动跑文生图)不再考虑4090 48G,等模式跑通了,再重新考虑自己的文生图/视频硬件怎么弄,x99这台的作用可能也重新再考虑。
-
7900XTX
双卡7900XTX 得用PCIE延长线,把另一张卡引出来。而且双路是跑不了双卡TP的。只能单路跑双卡TP
@Geekyang 感谢大大 学习了
-
@Xiaote 感谢大佬的详细说明
看完您的说明之后,我打算这么安排:
1.X99机器 跑qwen3.8,暂时不动了
2.先租算力 跑 minimax(跑通 由hermes agent 自动跑文生图)不再考虑4090 48G,等模式跑通了,再重新考虑自己的文生图/视频硬件怎么弄,x99这台的作用可能也重新再考虑。
@Xiaote 感谢大佬的详细说明
看完您的说明之后,我打算这么安排:
1.X99机器 跑qwen3.8,暂时不动了
2.先租算力 跑 minimax(跑通 由hermes agent 自动跑文生图)不再考虑4090 48G,等模式跑通了,再重新考虑自己的文生图/视频硬件怎么弄,x99这台的作用可能也重新再考虑。
我觉得你可以考虑反过来, 让Hermes先用在线的deepseek, 本地跑ComfyUI. 这样应该比较便宜. 因为出图出视频你要抽卡, 租算力我估计价格不合适.
平时你不需要批量出图的时候, 切回本地的llm, 继续驱动Hermes.
-
@坤坤 请问您是跑起来双卡吗?