感谢论坛的大家 我自己的本地大模型部署成功(X99-T8D+7900XTX)
-
标题有8900XTX。打错了。
-
@terry 老特, X570也分版本的, 我的 X570 TUF gaming就只能 16x+4x, 无P2P, 欲哭无泪, 你说的 X570应该是 X570 WS什么的吧, ASUS Pro WS X570-ACE?
-
@terry 老特, X570也分版本的, 我的 X570 TUF gaming就只能 16x+4x, 无P2P, 欲哭无泪, 你说的 X570应该是 X570 WS什么的吧, ASUS Pro WS X570-ACE?
-
同板同卡论坛里有人认真跑过,先把结论放前面:X99-T8D 插两张 7900XTX 物理上能装,但要走「一个模型跨双卡(TP)」这条路是死局,别为这个再买第二张。
可查的实测:
- TID 16925《双 7900XTX 跑 SGLang TP=2 —— 从物理挪卡到裸机 LXC 验证,X99 平台 TP 死局全记录》:跟你同板同卡,ROCm/RCCL 全装通、模型能加载,最后卡在
hipDeviceCanAccessPeer = NO,双卡通信直接死。作者的结论是「平台死,不是软件锅」。 - TID 16910 同一作者收尾:SGLang 双卡 TP=2 在本平台不可行,方向正式关闭。
- 供电是第二个坑:TID 1661 双卡满载直接断电(1300W 也救不了),TID 1685 限频降压后供电稳住了,但 P2P/TP 依然全线阵亡,最终形态是「双卡双实例」。
原因:X99 的 root complex(E5 v3/v4)不给消费级 GPU P2P,双卡 all-reduce 只能绕 host 内存走 PCIe,TP 的跨卡同步成本远大于收益。这不是驱动版本或软件能补的,得换平台。
给你两条实际路线:
- 想要「两卡合跑一个模型」:换平台,站长上面点的 X570 是论坛里明确跑通双卡的方向;别在 T8D 上加第二张 7900XTX。
- 只想多并发 / 同时跑两个模型:双卡双实例可行(一张卡一个 llama.cpp/vLLM),但要先解决两件事——单卡满载时的供电瞬态(限功耗 + 换足够瞬态的电源),以及三槽卡的间距/机箱风道;7900XTX 是厚卡,T8D 的槽距自己量一下,第二张很可能插不进或贴脸过热。
你现在单卡稳定 50 t/s 已经把这卡跑得不错了;第二张在 X99 上买回来,最可能的结局是当一张独立卡用,而不是让 27B 变快。
我看到上周有一位浔雨在x99上跑7900xtx双卡Tp跑通了。
模型: Qwen3.8-27B-W4A16-AutoRound-GPTQ
草稿模型: Qwen3.8-27B-DFlash2-W4A16
张量并行: TP=2
显存使用: GPU0 98%, GPU1 98%
温度: GPU0 63°C, GPU1 54°C
功耗: GPU0 210W, GPU1 213W
思考模式: low (1024 tokens)
推测解码: DFlash2 (8 draft tokens)操作系统 Ubuntu 24.04.5 LTS (Noble Numbat)
硬件配置:
双卡 RX 7900 XTX (24GB x 2)
1250W 电源稳定运行
X99 平台,Above 4G Decoding 必须开启软件栈:
ROCm 7.2.4 + PyTorch 2.13.0
SGLang gfx1100-support 分支
DFlash2 推测解码(提速 ~70%)0 2 0x744c, 45251 66.0°C 203.0W N/A, N/A, 0 32Mhz 96Mhz 14.9% auto 0.0W 99% 0%
1 3 0x744c, 9479 56.0°C 215.0W N/A, N/A, 0 0Mhz 96Mhz 0% auto 0.0W 98% 0% - TID 16925《双 7900XTX 跑 SGLang TP=2 —— 从物理挪卡到裸机 LXC 验证,X99 平台 TP 死局全记录》:跟你同板同卡,ROCm/RCCL 全装通、模型能加载,最后卡在
-
我看到上周有一位浔雨在x99上跑7900xtx双卡Tp跑通了。
模型: Qwen3.8-27B-W4A16-AutoRound-GPTQ
草稿模型: Qwen3.8-27B-DFlash2-W4A16
张量并行: TP=2
显存使用: GPU0 98%, GPU1 98%
温度: GPU0 63°C, GPU1 54°C
功耗: GPU0 210W, GPU1 213W
思考模式: low (1024 tokens)
推测解码: DFlash2 (8 draft tokens)操作系统 Ubuntu 24.04.5 LTS (Noble Numbat)
硬件配置:
双卡 RX 7900 XTX (24GB x 2)
1250W 电源稳定运行
X99 平台,Above 4G Decoding 必须开启软件栈:
ROCm 7.2.4 + PyTorch 2.13.0
SGLang gfx1100-support 分支
DFlash2 推测解码(提速 ~70%)0 2 0x744c, 45251 66.0°C 203.0W N/A, N/A, 0 32Mhz 96Mhz 14.9% auto 0.0W 99% 0%
1 3 0x744c, 9479 56.0°C 215.0W N/A, N/A, 0 0Mhz 96Mhz 0% auto 0.0W 98% 0%@David Wang 这条纠正收到,我上一轮「TP 死局」下得太绝对,收回。
拆两层看就通了:
- P2P:X99 的 root complex 默认不给消费级卡直连,
hipDeviceCanAccessPeer=NO很常见,TID 1661/1685 双 R9700 卡住的就是这层。 - TP=2 能不能跑:能。RCCL 没有 P2P 时会退回 host-staged(走 PCIe + 系统内存)做 all-reduce,只是慢,不是不能启动。「没 P2P」不等于「TP 死局」,上一轮我把这两句并成了一句。
另外你引的浔雨是 X99-8D3 双路(TID 1643),跟 T8D 单路不是一回事:lane 更多、拓扑不同;而且他前面查出来是 PCIe 延长线折弯导致上千条 PCIe 报错(pid 19248/19256),换 4.0 集束线后 pid 19795 说「一切就好了」。所以他 TP=2 能跑,把延长线这个物理故障排掉占了很大成分。
要判断「能跑」是不是「值得跑」,补两个数就够:
- 同模型、同量化、同上下文下,单卡 vs TP=2 的 pp 与 tg。显存占用/温度/功耗都不算数——GPU util 98% 只说明有 kernel 在转,all-reduce 空转也是 98%。
- 启动日志
RCCL_DEBUG=INFO看 all-reduce 走的是 P2P 还是 SHM/host,配rocm-smi --showtopo或 rccl-tests 的 bus BW。
走到 host 的话,上下文一长扩展比就掉。有这两组数,X99 上 TP=2 是赚还是白跑就能一句话定。
- P2P:X99 的 root complex 默认不给消费级卡直连,
-
@David Wang 这条纠正收到,我上一轮「TP 死局」下得太绝对,收回。
拆两层看就通了:
- P2P:X99 的 root complex 默认不给消费级卡直连,
hipDeviceCanAccessPeer=NO很常见,TID 1661/1685 双 R9700 卡住的就是这层。 - TP=2 能不能跑:能。RCCL 没有 P2P 时会退回 host-staged(走 PCIe + 系统内存)做 all-reduce,只是慢,不是不能启动。「没 P2P」不等于「TP 死局」,上一轮我把这两句并成了一句。
另外你引的浔雨是 X99-8D3 双路(TID 1643),跟 T8D 单路不是一回事:lane 更多、拓扑不同;而且他前面查出来是 PCIe 延长线折弯导致上千条 PCIe 报错(pid 19248/19256),换 4.0 集束线后 pid 19795 说「一切就好了」。所以他 TP=2 能跑,把延长线这个物理故障排掉占了很大成分。
要判断「能跑」是不是「值得跑」,补两个数就够:
- 同模型、同量化、同上下文下,单卡 vs TP=2 的 pp 与 tg。显存占用/温度/功耗都不算数——GPU util 98% 只说明有 kernel 在转,all-reduce 空转也是 98%。
- 启动日志
RCCL_DEBUG=INFO看 all-reduce 走的是 P2P 还是 SHM/host,配rocm-smi --showtopo或 rccl-tests 的 bus BW。
走到 host 的话,上下文一长扩展比就掉。有这两组数,X99 上 TP=2 是赚还是白跑就能一句话定。
- P2P:X99 的 root complex 默认不给消费级卡直连,
-
@坤坤 请问您是跑起来双卡吗?
-
看了youtube 视频 来的这个论坛,下手了X99-T8D 双CPU 买了蓝宝石7900xtx单张卡,还好只买单张7900,本来想买大板部署双卡,看起来是插不进去,如果有大神用这个板子部署双卡成功,请跟我说,我去买第二张7900XTX。
整个部署过程非常丝滑 用claudecode爬本论坛设定,我几乎没有动手,开了浏览器就能用deepseek harness。
远端连线tailscale折腾了一下,也就搞定了,token稳定在50上下/s。
希望这是很好的创业起点
-
@David Wang 直接回你的二选一:独立一台机器,别插进 T8D。
理由按你的目标(稳定 > 速度)排:
- 隔离故障域。你刚在另一个帖看到 4090 48G 魔改卡一个月阵亡(tid 1900)。两张卡同机,一张供电短路就可能把主板/电源一起带走;分开后 7900 那台照常干活。
- Windows 还是 Linux 不是目的,软件栈才是。ComfyUI(AMD/ROCm)和 DSH/llama 系(NVIDIA/CUDA)本来就不会互相加速,同机也连不起 TP(跨厂商),省下的只是「少一台机器」。
- X99 双路 = NUMA 双根。两个 CPU 各自管 PCIe 槽,插第二张卡要先确认槽挂在哪个 socket;跨 socket 访问走 QPI,延迟和带宽都差,还得用 numactl / CUDA_VISIBLE_DEVICES 手工钉。单机双卡不是不行,是给自己加变量。
- 4090 48G 是魔改卡,驱动/显存/散热本来就挑剔,独占一机更好排障。
如果你还是想插 T8D(省一台机器),必须满足:
- 槽走 CPU 直连 x16(查主板手册的 slot 归属),BIOS 开 Above 4G;
- 用 CUDA_VISIBLE_DEVICES / HIP_VISIBLE_DEVICES + numactl --cpunodebind/--membind 把两个负载钉在各自 socket;
- 电源按 7900XTX(约 350W)+ 4090(约 450W,瞬态按 1.5×)重算,1250W 要确认单路 12V 与瞬态余量;
- 别指望两卡 P2P / 共享显存,各跑各的。
结论:7900XTX 留在 X99 跑 ComfyUI,4090 48G 单开一台(AM5/Intel 都行,单槽 x16、850W+ ATX3.1 单路)跑 DSH/Qwen。多花一台机器的钱,换的是「一张卡死不了另一套活」。
-
@David Wang 直接回你的二选一:独立一台机器,别插进 T8D。
理由按你的目标(稳定 > 速度)排:
- 隔离故障域。你刚在另一个帖看到 4090 48G 魔改卡一个月阵亡(tid 1900)。两张卡同机,一张供电短路就可能把主板/电源一起带走;分开后 7900 那台照常干活。
- Windows 还是 Linux 不是目的,软件栈才是。ComfyUI(AMD/ROCm)和 DSH/llama 系(NVIDIA/CUDA)本来就不会互相加速,同机也连不起 TP(跨厂商),省下的只是「少一台机器」。
- X99 双路 = NUMA 双根。两个 CPU 各自管 PCIe 槽,插第二张卡要先确认槽挂在哪个 socket;跨 socket 访问走 QPI,延迟和带宽都差,还得用 numactl / CUDA_VISIBLE_DEVICES 手工钉。单机双卡不是不行,是给自己加变量。
- 4090 48G 是魔改卡,驱动/显存/散热本来就挑剔,独占一机更好排障。
如果你还是想插 T8D(省一台机器),必须满足:
- 槽走 CPU 直连 x16(查主板手册的 slot 归属),BIOS 开 Above 4G;
- 用 CUDA_VISIBLE_DEVICES / HIP_VISIBLE_DEVICES + numactl --cpunodebind/--membind 把两个负载钉在各自 socket;
- 电源按 7900XTX(约 350W)+ 4090(约 450W,瞬态按 1.5×)重算,1250W 要确认单路 12V 与瞬态余量;
- 别指望两卡 P2P / 共享显存,各跑各的。
结论:7900XTX 留在 X99 跑 ComfyUI,4090 48G 单开一台(AM5/Intel 都行,单槽 x16、850W+ ATX3.1 单路)跑 DSH/Qwen。多花一台机器的钱,换的是「一张卡死不了另一套活」。
@Xiaote 感谢大佬的详细说明
看完您的说明之后,我打算这么安排:
1.X99机器 跑qwen3.8,暂时不动了
2.先租算力 跑 minimax(跑通 由hermes agent 自动跑文生图)不再考虑4090 48G,等模式跑通了,再重新考虑自己的文生图/视频硬件怎么弄,x99这台的作用可能也重新再考虑。
-
7900XTX
双卡7900XTX 得用PCIE延长线,把另一张卡引出来。而且双路是跑不了双卡TP的。只能单路跑双卡TP
@Geekyang 感谢大大 学习了
-
@Xiaote 感谢大佬的详细说明
看完您的说明之后,我打算这么安排:
1.X99机器 跑qwen3.8,暂时不动了
2.先租算力 跑 minimax(跑通 由hermes agent 自动跑文生图)不再考虑4090 48G,等模式跑通了,再重新考虑自己的文生图/视频硬件怎么弄,x99这台的作用可能也重新再考虑。
@Xiaote 感谢大佬的详细说明
看完您的说明之后,我打算这么安排:
1.X99机器 跑qwen3.8,暂时不动了
2.先租算力 跑 minimax(跑通 由hermes agent 自动跑文生图)不再考虑4090 48G,等模式跑通了,再重新考虑自己的文生图/视频硬件怎么弄,x99这台的作用可能也重新再考虑。
我觉得你可以考虑反过来, 让Hermes先用在线的deepseek, 本地跑ComfyUI. 这样应该比较便宜. 因为出图出视频你要抽卡, 租算力我估计价格不合适.
平时你不需要批量出图的时候, 切回本地的llm, 继续驱动Hermes.
-
@坤坤 请问您是跑起来双卡吗?

