各位大佬,
背景
我在京东购入一张RTX 4080s 32gb的显卡,大概有一周时间了。
刚回来做了基础的显存测试,没有报错就正常使用了。

机器是跟着站长的推荐配的X99,X99-AD3主板,64gb 内存。
出错情况:
昨晚(08/31)使用RTX 4080s 运行llamacpp Qwen 3.8-27B,使用中途 突然发现llamacpp 无响应。使用Nvidia-smi命令查看发现,RTX 4080s 显卡出现Error,无法恢复。
Nvidia-smi 错误截图

使用hermes/deepseek 抓取了日志:

补充系统信息:
- 机器:AI 服务器 192.168.5.127(Ubuntu 24.04.4, Xeon E5-2686 v4 / 62GB / 双卡)
- 目标显卡:RTX 4080 SUPER 32GB(Bus 0x04, Device ID 0x2702, 魔改 32GB 版)
- 驱动:595.84 (open kernel), CUDA 13.2
Hermes/deepseek的错误分析
一、故障现象
| 时间 | 事件 |
|---|---|
| 21:11 | 系统开机,llama-server 自动启动(Qwen3.8-27-UD-XL,锁 4080 SUPER) |
| 21:33 | 正常运行,推理速度 40+ t/s |
| 21:56:08 | 任务 6600 启动,前 15 秒正常(40 t/s) |
| 21:57:03 | 内核检测 GPU1 心跳超时(差距 46s > 阈值 5.2s) |
| 21:57:33 | Memory Subsystem Error detected + TLB 失效失败 |
| 21:57:33 | Xid 175:GSP RPC 超时(等待 75s 无响应),pid=2033 llama-server |
| 21:57:36 | Xid 154:GPU recovery action → Reset Required |
| 21:59 | 服务强制取消任务,API 完全无响应 |
| 22:00+ | nvidia-smi 显示 4080:温度/功耗/风扇/时钟全部 ERR!,显存 27.3GB 冻结 |
症状总结:llama-server 推理速度暴跌(40→1 t/s)后 GPU 完全挂死,显存无法释放,
nvidia-smi --gpu-reset 报 Not Supported,唯一恢复手段是重启。
二、根因分析
证据链
- 内核日志:
kgmmuCheckMemSubsysError: Memory Subsystem Error detected+
kgmmuInvalidateTlb_GM107: TLB invalidation failed+ GSP 心跳超时 - 最终错误:Xid 175 (GSP RPC Timeout) → Xid 154 (Reset Required)
- "Memory Subsystem Error" 出现在 GSP 超时之后,为连锁检测结果
- 历史记录:往次开机(8/27、8/30)GPU 均正常,无类似故障
- 驱动 595.84 open kernel(2026-06-10 构建,较新)
判定
- 显存硬件故障嫌疑较高(Memory Subsystem Error 字面指向),但需压测验证
- 软件(驱动/GSP 固件)故障为次要嫌疑(Xid 175 是 GSP 固件无响应)
- 排除项:无 PCIe AER/总线错误(排除供电链路)、无 ECC 记录(消费卡不支持 ECC)
我做的额外测试
1) 使用hermes/deepseek 进行了 memtest_vulkan,跑了20min显存测试,没有错误。
2) 使用hermes/deepseek做了 GPU burn test(测核心),GPU能够跑满100%,功率达到满载 310w的样子,nvidia-smi显示的核心温度达到90℃,同时显卡发出响声(挺尖锐的声音,不是风扇的声音,感觉是不正常的声音),大概也就1-2min钟的样子,感觉不对劲,就手动停止了,没敢再接着测试。
希望大佬帮忙解答的:
- 这个是不是硬件有故障?从hermes 分析来看,我担心大概率是硬件有故障。京东后台看显卡在 9/4之前支持换货,之后估计就只能维修了。。我考虑要不要换货。已经不支持退货了。。“退货”的选项已经不能点了。
2)使用GPU burn test 测试显卡功率满载的时候,发出异常的响声(非风扇声音),这个正常吗?我感觉不太正常啊。
感谢版主,各位大佬