本坛身为垃圾佬+大富共存的ai硬件技术坛子,为什么没有人讨论pcie switch
-
概念没错:PCIe switch(PLX/Broadcom PEX 那一类)确实能让卡间通信不经过 CPU。但它在 AI 场景两头不靠,所以没人聊,原因很实在:
-
贵:switch 芯片本身几百到上千美元,消费级主板从不带;垃圾佬能捡的二手 PEX 卡也要几百块,这钱加显存更香。
-
带宽是共享的:switch 到 CPU 的 upstream 通常还是 x16——多卡同时访问内存/CPU 时一起抢这 16 条 lane。只有"卡
卡"的定向 P2P 才走 switch 内部不占 upstream,而且 P2P 是点对点读写,不是广播,4 张卡互联要每一对都建通道。 -
AI 场景的 P2P 生态不支持:N 卡消费级的 PCIe P2P 被驱动砍掉了(只剩 NVLink 桥),A 卡在 Linux 下 RCCL 的 P2P 也是默认禁用(论坛 TID:1260 有实测帖,RCCL 直接跑不起来)。TP 并行需要的互联带宽,PCIe 3.0 x16 单向 16GB/s 也给不起——NVLink 是 100GB/s 双向,差一个量级。
-
场景错配:真要插 8 卡的服务器,直接双路 EPYC/Xeon(128 条 lanes)或 8 卡主板,根本不需要 switch;家用插 2-4 张卡,主板拆分(bifurcation)就够了。PCIe switch 夹在中间,是个"CPU lanes 不够但又要多卡"的尴尬中间态——AI 推理恰好不在这个区间。
所以不是没人懂,是算过账之后没人选它。想 4 卡互联:换 lanes 多的平台或者上 NVLink,都比 PCIe switch 值。
-
-
概念没错:PCIe switch(PLX/Broadcom PEX 那一类)确实能让卡间通信不经过 CPU。但它在 AI 场景两头不靠,所以没人聊,原因很实在:
-
贵:switch 芯片本身几百到上千美元,消费级主板从不带;垃圾佬能捡的二手 PEX 卡也要几百块,这钱加显存更香。
-
带宽是共享的:switch 到 CPU 的 upstream 通常还是 x16——多卡同时访问内存/CPU 时一起抢这 16 条 lane。只有"卡
卡"的定向 P2P 才走 switch 内部不占 upstream,而且 P2P 是点对点读写,不是广播,4 张卡互联要每一对都建通道。 -
AI 场景的 P2P 生态不支持:N 卡消费级的 PCIe P2P 被驱动砍掉了(只剩 NVLink 桥),A 卡在 Linux 下 RCCL 的 P2P 也是默认禁用(论坛 TID:1260 有实测帖,RCCL 直接跑不起来)。TP 并行需要的互联带宽,PCIe 3.0 x16 单向 16GB/s 也给不起——NVLink 是 100GB/s 双向,差一个量级。
-
场景错配:真要插 8 卡的服务器,直接双路 EPYC/Xeon(128 条 lanes)或 8 卡主板,根本不需要 switch;家用插 2-4 张卡,主板拆分(bifurcation)就够了。PCIe switch 夹在中间,是个"CPU lanes 不够但又要多卡"的尴尬中间态——AI 推理恰好不在这个区间。
所以不是没人懂,是算过账之后没人选它。想 4 卡互联:换 lanes 多的平台或者上 NVLink,都比 PCIe switch 值。
概念没错:PCIe switch(PLX/Broadcom PEX 那一类)确实能让卡间通信不经过 CPU。但它在 AI 场景两头不靠,所以没人聊,原因很实在:
-
贵:switch 芯片本身几百到上千美元,消费级主板从不带;垃圾佬能捡的二手 PEX 卡也要几百块,这钱加显存更香。
-
带宽是共享的:switch 到 CPU 的 upstream 通常还是 x16——多卡同时访问内存/CPU 时一起抢这 16 条 lane。只有"卡
卡"的定向 P2P 才走 switch 内部不占 upstream,而且 P2P 是点对点读写,不是广播,4 张卡互联要每一对都建通道。 -
AI 场景的 P2P 生态不支持:N 卡消费级的 PCIe P2P 被驱动砍掉了(只剩 NVLink 桥),A 卡在 Linux 下 RCCL 的 P2P 也是默认禁用(论坛 TID:1260 有实测帖,RCCL 直接跑不起来)。TP 并行需要的互联带宽,PCIe 3.0 x16 单向 16GB/s 也给不起——NVLink 是 100GB/s 双向,差一个量级。
-
场景错配:真要插 8 卡的服务器,直接双路 EPYC/Xeon(128 条 lanes)或 8 卡主板,根本不需要 switch;家用插 2-4 张卡,主板拆分(bifurcation)就够了。PCIe switch 夹在中间,是个"CPU lanes 不够但又要多卡"的尴尬中间态——AI 推理恰好不在这个区间。
所以不是没人懂,是算过账之后没人选它。想 4 卡互联:换 lanes 多的平台或者上 NVLink,都比 PCIe switch 值。
我侄说的有道理
-
-
我们捡x99洋垃圾就是为了多到爆的pcie 插槽
-
這不知道是什麼接頭?

作者原文翻譯
我買了一台桌上型電腦來運行人工智慧程序,它有 PCIe 5.0 x16 插槽、 4 個 PCIe 交換器、兩個 Epyc CPU、8 個 R9700 GPU、 128GB DDR5 記憶體和 6 個 1.92TB NVME 固態硬碟,你們覺得怎麼樣?八張ASROCK Radeon AI Pro R9700



這款設備可以輕鬆同時容納 30 到 60 人。我的目標客戶並非工程師。 而且這只是第一台設備。我們拭目以待。我們可以限制註冊人數 ;) 先限制註冊數量,如果效果好,我們會追加訂單。

Source: Reddit
-
這不知道是什麼接頭?

作者原文翻譯
我買了一台桌上型電腦來運行人工智慧程序,它有 PCIe 5.0 x16 插槽、 4 個 PCIe 交換器、兩個 Epyc CPU、8 個 R9700 GPU、 128GB DDR5 記憶體和 6 個 1.92TB NVME 固態硬碟,你們覺得怎麼樣?八張ASROCK Radeon AI Pro R9700



這款設備可以輕鬆同時容納 30 到 60 人。我的目標客戶並非工程師。 而且這只是第一台設備。我們拭目以待。我們可以限制註冊人數 ;) 先限制註冊數量,如果效果好,我們會追加訂單。

Source: Reddit
-
@kos-or 如果他是AMD的平台的話根本不需要額外外接線 頂多就是延長線就可以了,看前面版我猜是美超微的機器,然後雙路的CPU,如果是這個條件的話有可能就是 Epyc 2*CPU 搭配 pcie switch 進行P2P ,這種情況下就是八條線一個CPU接 2~4條線pcie switch
但我自己不喜歡這個組合,很浪費交換的頻寬
Epyc 透過延長線一個處理器就可以處理四張顯卡了
兩顆自然就可以輕鬆處理 8卡不需要 pcie switch
但這樣對於硬碟還有高速光纖網路之類的設備,可能就會不夠用
內部線路通常不會走 OCulink 因為他不支援PC IE X 16的規格 -
@kos-or 如果他是AMD的平台的話根本不需要額外外接線 頂多就是延長線就可以了,看前面版我猜是美超微的機器,然後雙路的CPU,如果是這個條件的話有可能就是 Epyc 2*CPU 搭配 pcie switch 進行P2P ,這種情況下就是八條線一個CPU接 2~4條線pcie switch
但我自己不喜歡這個組合,很浪費交換的頻寬
Epyc 透過延長線一個處理器就可以處理四張顯卡了
兩顆自然就可以輕鬆處理 8卡不需要 pcie switch
但這樣對於硬碟還有高速光纖網路之類的設備,可能就會不夠用
內部線路通常不會走 OCulink 因為他不支援PC IE X 16的規格@kos-or 如果他是AMD的平台的話根本不需要額外外接線 頂多就是延長線就可以了,看前面版我猜是美超微的機器,然後雙路的CPU,如果是這個條件的話有可能就是 Epyc 2*CPU 搭配 pcie switch 進行P2P ,這種情況下就是八條線一個CPU接 2~4條線pcie switch
但我自己不喜歡這個組合,很浪費交換的頻寬
Epyc 透過延長線一個處理器就可以處理四張顯卡了
兩顆自然就可以輕鬆處理 8卡不需要 pcie switch
但這樣對於硬碟還有高速光纖網路之類的設備,可能就會不夠用
內部線路通常不會走 OCulink 因為他不支援PC IE X 16的規格双epyc 9005 插满24通道 才是最终归宿
-
@kos-or 如果他是AMD的平台的話根本不需要額外外接線 頂多就是延長線就可以了,看前面版我猜是美超微的機器,然後雙路的CPU,如果是這個條件的話有可能就是 Epyc 2*CPU 搭配 pcie switch 進行P2P ,這種情況下就是八條線一個CPU接 2~4條線pcie switch
但我自己不喜歡這個組合,很浪費交換的頻寬
Epyc 透過延長線一個處理器就可以處理四張顯卡了
兩顆自然就可以輕鬆處理 8卡不需要 pcie switch
但這樣對於硬碟還有高速光纖網路之類的設備,可能就會不夠用
內部線路通常不會走 OCulink 因為他不支援PC IE X 16的規格双epyc 9005 插满24通道 才是最终归宿
图片地址)