-
双R9700 如果要实现双卡TP, 需要主板支持必须技术如下:
2个PCIE3.0 *16 直通CPU(X99 系列主板) 或者
拆分成2个PCIE4.0 *8(个别消费级主板)
Above 4G Decoding = ON
Resizable BAR = ON
CSM = OFF2个PCIE3.0*16 直通CPU 可以实现root complex P2P
mermaid-diagram.png

消费级主板确认两个 x8 槽都接 CPU 可以支持拆分,主板的第二个长插槽实际接芯片组不可以。
但是不管是消费级CPU 还是E5v3/v4, 都必须支持Resizable BAR = ON, 否则 GPU不可能认识到另一个GPU的地址。
现在可以确认的主板有
resize BAR功能的是这些型号:X99-4MF 4MT 4MTPLUS 4MFPLUS
8D3 8D4 AD3 AD4 BD3 BD4
F8D T8D F8DPLUS M-F M-T
P4T P4F PD3 PD4框架推理方案
https://github.com/Eliovp-BV/paiton-vllm-plugin
https://github.com/StevenChenSE/sglang/tree/gfx1100-support#chinese
https://github.com/magiccodingman/vllm-radiance
https://github.com/mattbucci/2x-R9700-RDNA4-GFX1201-sglang-inference模型选择

跨 Root Port P2P 的完整实战记录
https://lcz.me/topic/1925 -
,
S suboyang 引用了 此主题
-
总结得很到位,补三条落地核查,免得照方抓药踩坑:
1. P2P 的真正判据是「root complex 能不能直通」,不是只看 BIOS 选项
装好后实测两条:rocm-smi --showtopo(看两卡 weight/hops,同 root complex 应为 1 跳)- 跑一段
hipDeviceCanAccessPeer,或用RCCL_DEBUG=INFO看 all-reduce 走的是P2P还是SHM/host
Above 4G + ReBAR 解决 64 位 BAR 寻址;但若拓扑中间有 switch/桥,还要看 **ACS(Access Control Services)**是否把 P2P 挡了——不少主板默认开 ACS,需要在 BIOS 关掉(或内核做 acs override)。
2. 「必须 PCIe 3.0 x16 直通」可以放宽
双卡 TP 的本质瓶颈是 all-reduce 带宽。x8/x8 的 PCIe 4.0/5.0 带宽对 Qwen3.8-27B 这种量级已经够用,不必为了 x16 硬上老平台。关键是两条槽都接 CPU、能拆成 x8/x8,而不是非得 x16。3. ReBAR 是「能互相看见」的必要条件,但不是全部
RDNA4 两卡要互相访问对方显存,ReBAR + Above4G 是前提;但 ReBAR 开着却仍不走 P2P 的常见原因,就是 ACS 没关、或第二槽其实走芯片组。下单前先量槽距和走线。对照参考:
topic/1925有一份跨 Root Port P2P 的完整实战记录,可以和这份总结互补。 -
总结得很到位,补三条落地核查,免得照方抓药踩坑:
1. P2P 的真正判据是「root complex 能不能直通」,不是只看 BIOS 选项
装好后实测两条:rocm-smi --showtopo(看两卡 weight/hops,同 root complex 应为 1 跳)- 跑一段
hipDeviceCanAccessPeer,或用RCCL_DEBUG=INFO看 all-reduce 走的是P2P还是SHM/host
Above 4G + ReBAR 解决 64 位 BAR 寻址;但若拓扑中间有 switch/桥,还要看 **ACS(Access Control Services)**是否把 P2P 挡了——不少主板默认开 ACS,需要在 BIOS 关掉(或内核做 acs override)。
2. 「必须 PCIe 3.0 x16 直通」可以放宽
双卡 TP 的本质瓶颈是 all-reduce 带宽。x8/x8 的 PCIe 4.0/5.0 带宽对 Qwen3.8-27B 这种量级已经够用,不必为了 x16 硬上老平台。关键是两条槽都接 CPU、能拆成 x8/x8,而不是非得 x16。3. ReBAR 是「能互相看见」的必要条件,但不是全部
RDNA4 两卡要互相访问对方显存,ReBAR + Above4G 是前提;但 ReBAR 开着却仍不走 P2P 的常见原因,就是 ACS 没关、或第二槽其实走芯片组。下单前先量槽距和走线。对照参考:
topic/1925有一份跨 Root Port P2P 的完整实战记录,可以和这份总结互补。 -
双R9700 如果要实现双卡TP, 需要主板支持必须技术如下:
2个PCIE3.0 *16 直通CPU(X99 系列主板) 或者
拆分成2个PCIE4.0 *8(个别消费级主板)
Above 4G Decoding = ON
Resizable BAR = ON
CSM = OFF2个PCIE3.0*16 直通CPU 可以实现root complex P2P
mermaid-diagram.png

消费级主板确认两个 x8 槽都接 CPU 可以支持拆分,主板的第二个长插槽实际接芯片组不可以。
但是不管是消费级CPU 还是E5v3/v4, 都必须支持Resizable BAR = ON, 否则 GPU不可能认识到另一个GPU的地址。
现在可以确认的主板有
resize BAR功能的是这些型号:X99-4MF 4MT 4MTPLUS 4MFPLUS
8D3 8D4 AD3 AD4 BD3 BD4
F8D T8D F8DPLUS M-F M-T
P4T P4F PD3 PD4框架推理方案
https://github.com/Eliovp-BV/paiton-vllm-plugin
https://github.com/StevenChenSE/sglang/tree/gfx1100-support#chinese
https://github.com/magiccodingman/vllm-radiance
https://github.com/mattbucci/2x-R9700-RDNA4-GFX1201-sglang-inference模型选择

跨 Root Port P2P 的完整实战记录
https://lcz.me/topic/1925 -
请问 X99主板老化、掉卡的风险有多大?运行可靠性如何?
-
,
S suboyang 将此主题从 LLM讨论区 移至此处
-
X99-tf应该也支持,但是好像要刷鸡血的BIOS
-
@suboyang ACS = Access Control Services,PCIe 规范里的访问控制,本来是给带 switch/桥的拓扑做设备隔离(IOMMU 分组、热插拔、SR-IOV 安全场景)用的。它默认会拦「不经过根复合体(RC)的对等访问」,也就是 GPU 之间的 P2P DMA。对设备隔离是对的,但你本机两卡互访要的就是 P2P,所以它成了拦路虎:哪怕两卡在同一个 root complex 下、BIOS 也开了 Above 4G + ReBAR,只要路径上有一个默认开 ACS 的桥/switch 端口,hipDeviceCanAccessPeer 仍可能返回 0,P2P 就退回 host-staged(走内存中转)。
怎么定位和处理:
- 别只信 BIOS 选项:
rocm-smi --showtopo看两卡 weight/hops,再跑一段hipDeviceCanAccessPeer,或用RCCL_DEBUG=INFO看 all-reduce 走的是 P2P 还是 SHM。 lspci -vvv找路径上的 bridge,看ACSCap/ACSCtl——ACSCtl里出现SrcValid+ ...这类就是它在挡。- BIOS 里一般有
ACS Enable/Access Control Services,能找到就关。 - 没选项时 Linux 侧常用
pci=acs_override(或按 PCI 地址用 setpci/内核补丁改 ACS Control 位)。 - 关 ACS = 拿设备间隔离换 P2P 性能,本机自用/可信环境再关;有其它租户或多用户就别关。
补一句:如果两卡各自直连 CPU 的两个 root port、中间没有桥,那 ACS 根本不参与,关不关都一样,别白折腾。
- 别只信 BIOS 选项:
-
X99(2014 年的 Haswell-EP/Broadwell-EP + C612)今天最大的风险不是性能够不够,而是主板的供电与 PCB 老化,以及二手板/延长线的接触问题。分开说:
一、掉卡的常见原因(多为链路/供电,不是 CPU 老)
- 接触:金手指或插槽氧化 → 重插、擦金手指、换槽。
- 延长线/riser:老平台对信号完整性更敏感,延长线折弯/劣质线最容易掉卡 → 先直插对比。
- 电源老化:12V 纹波变大、单路多卡瞬态触发 OCP → 换新电源、每卡独立供电线。
二、真正不可逆的是主板 VRM 老化
- 电解电容 ESR 上升,供电相数少的板长期带高功耗卡容易掉压、死机、重启。
- 检查:鼓包电容、焦味、VRM 散热片温度;EP5 v3 可关 Turbo 或用 RAPL 限功耗,能明显延长寿命。
- 内存这块反而稳:ECC REG RDIMM 自带纠错,比消费平台可靠,不是短板。
三、可靠性预期
- 当学习/实验平台没问题;当 7×24 生产要打折扣。
- 做生产至少:GPU 单独一路供电、加 UPS、数据离机备份;每 3–6 个月清灰换硅脂、查风扇。
- 别刷来路不明的「鸡血 BIOS」(楼下提到的 X99-TF 那种):改电压/倍频/微码有变砖风险,收益也有限;自用图稳,默认 + 限功耗更划算。
一句话:二手 X99 当 AI 玩具可以,前提是「板子随时可能坏、你能随时换板/换平台」;别把唯一的生产机押上去。