跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. Asus ROG Flow Z13 幻X(Strix Halo)透過 USB4 外接 Gigabyte 5090 Ai Box eGPU,Linux 下 CUDA 運算崩潰— 完整除錯紀錄與技術總結

Asus ROG Flow Z13 幻X(Strix Halo)透過 USB4 外接 Gigabyte 5090 Ai Box eGPU,Linux 下 CUDA 運算崩潰— 完整除錯紀錄與技術總結

已定时 已固定 已锁定 已移动 AI硬件
2 帖子 2 发布者 122 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • M 离线
    M 离线
    MSHAVL
    发表于 最后由 编辑
    #1

    Asus ROG Flow Z13(Strix Halo)透過 USB4 外接 RTX 5090 eGPU,Linux 下 CUDA 運算必崩

    ⚠️ TL;DR(先看這裡)

    • Blackwell(RTX 5090)+ TB4/USB4 eGPU + Linux = 任何 CUDA 運算都會讓整機瞬間斷電。
    • 這是 NVIDIA GSP 韌體 RPC 心跳在隧道延遲下逾時,NVIDIA 尚未修復。
    • 換驅動版本無效。同一組硬體在 Windows 下完全正常。

    💡 確認方式只要 30 秒: 接上 → 載入驅動 → 跑任何 CUDA kernel。活著 = 修好了,斷電 = 還沒。

    ✅ 在那之前,雙開機用 Windows 是完全合理的答案,不是妥協。


    環境

    項目 規格
    主機 Asus ROG Flow Z13 (GZ302EA)
    SoC AMD Ryzen AI MAX+ 395 (Strix Halo)
    USB4 埠 USB4 40Gbps(PCIe 隧道封裝)
    eGPU GIGABYTE AORUS RTX 5090 AI BOX (TB5)
    OS Ubuntu 26.04 LTS, kernel 7.0.0-14

    症狀

    GPU 正常初始化、nvidia-smi 閒置時完全正常、模型能載入 VRAM。

    🔴 但任何 CUDA 運算都會讓整機瞬間斷電 —— 無 kernel panic、無 Xid、無 AER、SysRq 無反應,journald 連一行都來不及寫。


    決定性的二分測試

    我寫了一支 CUDA 程式把「PCIe 傳輸」與「GPU 運算」分開:

    測試 結果
    PCIe 傳輸 150 GB 來回(64 MiB → 4 GiB 五級) ✅ 全數存活,實測 0.78 GB/s
    GPU 運算核心 ❌ 立即整機斷電,無一次例外

    💡 傳輸沒問題,運算必死。 這一刀切下去,後面所有的猜測都可以停止。


    已排除的假設(每項都有實測數據)

    假設 排除依據
    記憶體不足 / OOM 崩潰時 available 120 GiB
    與 iGPU 模型共存衝突 主模型未執行仍崩潰
    amdgpu SVM 分頁風暴 相關 kernel worker 計數全程 0
    eGPU 盒經 USB4 反向供電 主機使用自己的充電器
    顯卡功耗尖峰 崩潰時僅 85W(上限 575W)
    PCIe 錯誤 / 掉線 無 AER、無 Xid、無 Link Down
    過熱 GPU 43°C
    DRAM-less SSD (HMB) 零 NVMe 錯誤

    真正的原因

    這是 NVIDIA 的已知且未修復問題:

    • open-gpu-kernel-modules issue #979
    • NVIDIA 論壇:AORUS AI BOX CUDA hard-lock

    核心錯誤:

    GPU1 _kgspRpcRecvPoll: LibOS heartbeat timed out
    kgspInitRm_IMPL: SET_GUEST_SYSTEM_INFO failed
    

    Blackwell 把大量工作交給 GPU 上的 GSP 韌體,主機與 GSP 之間靠 RPC 溝通並有心跳逾時。

    🔴 透過 TB4/USB4 隧道時延遲過高 → 心跳逾時 → 硬鎖。

    上游歸納的模式:TB5 主機正常,TB4/USB4 主機必崩。

    Z13 的埠是 USB4 40Gbps,AORUS 盒是 TB5 —— 協商後降為 USB4,正中此模式。

    💡 這也解釋了為什麼同一組硬體在 Windows 下可以正常推論:驅動架構不同,沒有這條 RPC 路徑。


    試過但無效的所有方法

    嘗試 結果
    nvidia-driver-595-open 崩潰
    nvidia-driver-595(專有版) ❌ 無法使用 —— GB202 強制要求 open kernel modules
    nvidia-driver-610-open(論壇唯一有成功先例) 崩潰 ×2
    pcie_ports=native pcie_aspm=off pcie_port_pm=off 無效
    pci=assign-busses,realloc,hpmmiosize=... ❌ 弄壞了 iGPU
    換 USB4 埠 PCIe 鏈路改善,仍崩潰

    ⚠️ 坑:pci=assign-busses 會重新編號整台機器的 PCI 匯流排

    從 eGPU 論壇抄了一組核心參數一次全加,結果:

    iGPU 位址 c4:00.0 → 06:00.0
    amdgpu 載入了但綁不上去
    rocminfo 找不到 gfx1151
    GTT 消失
    

    🔴 在一台整個 LLM 部署都靠 iGPU 的機器上,我把 iGPU 弄壞了。

    ✅ 教訓:PCIe 參數要一次只加一個,每次都驗證既有裝置仍正常。


    附帶發現

    USB4 埠的選擇會影響 PCIe 鏈路

    Z13 有兩個 USB4 埠,對應不同橋接器,鏈路品質差很多:

    埠 下游鏈路
    00:01.2 2.5 GT/s (Gen1)
    00:01.1 16.0 GT/s x4 (Gen4)

    💡 同一台機器、同一條線、同一個盒子,換個孔差 6 倍。

    ✅ 如果你的 eGPU 慢得莫名其妙,先試另一個埠。

    每次硬鎖後,eGPU 盒必須實體斷電

    單純重開機救不回來。未斷電就重開時:

    nvidia-smi          → 讀得到基本資訊
    cudaSetDevice()     → CUDA-capable device(s) is/are busy or unavailable
                        → 而且一試就再次弄掛驅動
    

    ⚠️ 驅動卡死後不要重複執行 nvidia-smi —— 每次都會多一個 D state 且 kill -9 無效的進程,nvidia_uvm 引用計數只增不減。


    ✅ 給後來者的建議

    如果你想用 Strix Halo + USB4 + RTX 5090:

    • Windows 側: ✅ 正常可用,沒問題。
    • Linux 側: ❌ 目前(2026-08)任何 CUDA 運算必崩,NVIDIA 尚未修復。
    • 確認方式只要 30 秒: 接上 → 載入驅動 → 跑任何 CUDA kernel。活著 = 修好了,斷電 = 還沒。
    • 在那之前,雙開機用 Windows 是完全合理的答案,不是妥協。

    如果你要在 Z13 上玩 eGPU(不管用不用 AI):

    • 兩個 USB4 埠鏈路品質差 6 倍,務必接 00:01.1 那側(16 GT/s x4)。
    • PCIe 核心參數要一次只加一個,不要一次全加。
    • 每次硬鎖後,實體斷電 eGPU 盒再重開。
    • 驅動卡死後不要重複執行 nvidia-smi。
    1 条回复 最后回复
    1
    • terryT 离线
      terryT 离线
      terry
      超级版主
      发表于 最后由 terry 编辑
      #2

      非常好的分享,发帖格式规整,高亮到位,问题阐述的非常清晰,用心了。

      其实显卡坞的事,也就是EGPU纯粹是玄学,A卡和N卡,雷电3 4, Oculink我都用过,Oclink要好点,N卡要好点。但也是各种问题。要能补充点实拍图就好了,不然大片表格容易被谷歌判定为垃圾内容,网站已经被丢入沙盒了。😢

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0
      • terryT terry 于 将此主题固定
      • 系统 于 取消固定此主题

      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

      有了你的建议,这篇帖子会更精彩哦 💗

      注册 登录
      回复
      • 在新帖中回复
      登录后回复
      • 从旧到新
      • 从新到旧
      • 最多赞同


      • 登录

      • 登录或注册以进行搜索。
      • 第一个帖子
        最后一个帖子
      0
      • 版块
      • 最新
      • 标签
      • 热门
      • 用户
      • 群组