新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
-
各位大佬,
背景
我在京东购入一张RTX 4080s 32gb的显卡,大概有一周时间了。
刚回来做了基础的显存测试,没有报错就正常使用了。

机器是跟着站长的推荐配的X99,X99-AD3主板,64gb 内存。
出错情况:
昨晚(08/31)使用RTX 4080s 运行llamacpp Qwen 3.8-27B,使用中途 突然发现llamacpp 无响应。使用Nvidia-smi命令查看发现,RTX 4080s 显卡出现Error,无法恢复。Nvidia-smi 错误截图

使用hermes/deepseek 抓取了日志:

补充系统信息:
- 机器:AI 服务器 192.168.5.127(Ubuntu 24.04.4, Xeon E5-2686 v4 / 62GB / 双卡)
- 目标显卡:RTX 4080 SUPER 32GB(Bus 0x04, Device ID 0x2702, 魔改 32GB 版)
- 驱动:595.84 (open kernel), CUDA 13.2
Hermes/deepseek的错误分析
一、故障现象时间 事件 21:11 系统开机,llama-server 自动启动(Qwen3.8-27-UD-XL,锁 4080 SUPER) 21:33 正常运行,推理速度 40+ t/s 21:56:08 任务 6600 启动,前 15 秒正常(40 t/s) 21:57:03 内核检测 GPU1 心跳超时(差距 46s > 阈值 5.2s) 21:57:33 Memory Subsystem Error detected + TLB 失效失败 21:57:33 Xid 175:GSP RPC 超时(等待 75s 无响应),pid=2033 llama-server 21:57:36 Xid 154:GPU recovery action → Reset Required 21:59 服务强制取消任务,API 完全无响应 22:00+ nvidia-smi 显示 4080:温度/功耗/风扇/时钟全部 ERR!,显存 27.3GB 冻结 症状总结:llama-server 推理速度暴跌(40→1 t/s)后 GPU 完全挂死,显存无法释放,
nvidia-smi --gpu-reset报 Not Supported,唯一恢复手段是重启。二、根因分析
证据链
- 内核日志:
kgmmuCheckMemSubsysError: Memory Subsystem Error detected+
kgmmuInvalidateTlb_GM107: TLB invalidation failed+ GSP 心跳超时 - 最终错误:Xid 175 (GSP RPC Timeout) → Xid 154 (Reset Required)
- "Memory Subsystem Error" 出现在 GSP 超时之后,为连锁检测结果
- 历史记录:往次开机(8/27、8/30)GPU 均正常,无类似故障
- 驱动 595.84 open kernel(2026-06-10 构建,较新)
判定
- 显存硬件故障嫌疑较高(Memory Subsystem Error 字面指向),但需压测验证
- 软件(驱动/GSP 固件)故障为次要嫌疑(Xid 175 是 GSP 固件无响应)
- 排除项:无 PCIe AER/总线错误(排除供电链路)、无 ECC 记录(消费卡不支持 ECC)
我做的额外测试
1) 使用hermes/deepseek 进行了 memtest_vulkan,跑了20min显存测试,没有错误。
2) 使用hermes/deepseek做了 GPU burn test(测核心),GPU能够跑满100%,功率达到满载 310w的样子,nvidia-smi显示的核心温度达到90℃,同时显卡发出响声(挺尖锐的声音,不是风扇的声音,感觉是不正常的声音),大概也就1-2min钟的样子,感觉不对劲,就手动停止了,没敢再接着测试。希望大佬帮忙解答的:
- 这个是不是硬件有故障?从hermes 分析来看,我担心大概率是硬件有故障。京东后台看显卡在 9/4之前支持换货,之后估计就只能维修了。。我考虑要不要换货。已经不支持退货了。。“退货”的选项已经不能点了。
2)使用GPU burn test 测试显卡功率满载的时候,发出异常的响声(非风扇声音),这个正常吗?我感觉不太正常啊。
感谢版主,各位大佬
-
我刚买4090,不会是大勤吧 0.0
-
@icyliving 结论先给:建议换货,别等维修。9/4 前能换就换,这个 Xid 175 + 异响组合不值得赌。
理由拆开说:
1. 错误链指向硬件问题,不是驱动
Xid 175(GSP RPC 超时)→ Xid 154(Reset Required)+ Memory Subsystem Error + TLB invalidation failed,这是 GPU 固件级挂死(GSP 75 秒无响应才报),正常卡上极其罕见。驱动 open kernel 595.84 是 2026-06 的版本不算新也不算旧,但"往次开机都正常、这次突然固件级挂死"更像硬件不稳定而不是驱动回归。驱动问题通常是复现性的(特定负载必炸),不是偶发一次。2. memtest 20 分钟无错 ≠ 硬件没问题
memtest_vulkan 只测显存静态读写,能排除坏点/固定位故障,排除不了两类魔改卡最常见的问题:- 虚焊/接触不良:温度上来、PCB 形变时才间歇性失效(你这次就是重载跑了 45 分钟后炸的)
- 加焊颗粒体质差:部分新增的 16GB 颗粒在高负载高温度下不稳定,平时测试碰不到
这类间歇性故障是 memtest 最难抓的,得过夜长测 + 反复重载才可能暴露。
3. burn test 的 90℃ + 尖锐异响是两个黄灯
- 4080S 原厂满载核心温度一般在 70-75℃ 区间,90℃ 偏高,魔改卡的散热规格(鳍片/背板/风扇曲线)不一定压得住多出来的 16G 颗粒
- 非风扇的尖锐声大概率是电感啸叫(coil whine)或供电模块异响。电感啸叫本身在满载高功率下不算致命,但"啸叫 + 固件级挂死 + 高温"三个信号叠在一起,没必要用保修期去赌
4. 换货 vs 维修的实际账
- 换货:9/4 前原店换新,周期几天,拿到的是另一张卡
- 维修:返店检测维修,周期一两周起,魔改卡店铺的维修质量参差,修完复发的不在少数(这卡本质是改卡,返修率高是行业常态)
- 你现在证据链够硬(Xid 175 + 异响 + 高温),直接申请换货,理由写"满载异响 + 推理时 GPU 固件超时挂死",别只说 memtest 没过(memtest 没抓到问题,商家会拿这个卡你)
5. 换货回来的验证流程
到手先别急着上生产:- memtest_vulkan 过夜跑(至少 4-6 小时)
- 满载压测 30 分钟以上,盯温度和有没有异响
- llama.cpp 多轮长上下文推理,反复重载
三项都过、无 Xid 无异常声,再正常用。
顺便说下:你机器是 X99-AD3 + E5-2686 v4 双卡,如果是两张 4080S 魔改 32G 组双卡跑 27B,之前论坛有同样 4080S 32G 魔改卡的讨论(TID:1311),魔改卡的常见坑和选型思路可以参考,别一上来就双卡 tensor-split,先单卡跑稳再说。
-
我刚买4090,不会是大勤吧 0.0
@Xuan-Giang-Ngo 就不说明说哪家了
希望有大佬帮我看看啊,我真担心有硬件问题,后边再断断续续出问题的话,就比较烦人了。
-
@Xuan-Giang-Ngo 就不说明说哪家了
希望有大佬帮我看看啊,我真担心有硬件问题,后边再断断续续出问题的话,就比较烦人了。
@icyliving 兄弟,该换就换啊。我之前故障的那张4090 48G,三次故障都是在运行comfyui大概二三十小时后出故障,有时候掉驱动就一直不行了,有时候关机一阵子后冷启动了正常,正常之后用OCCT跑100%显存测试,或者GPU 100%负载测试,测个半小时也不出问题,用furymark跑也跑不出问题。但是再跑comfyui,显存加载到近100%,某个运算过程就出错了。这种卡不要消耗自己精力去验证是不是自己的软件环境问题。要是有个其他卡能测出来不是自己的软件问题就别纠结了,赶紧换。不换到时候修,像我之前一样修个四次,两个月才修好,很麻烦的。我后面第三次故障,故障了换上原厂版本4080S 16G不出问题,就返修了。之前每次故障后还不断排查自己软件问题,系统重装了两次,驱动不知道换了多少个版本,花了不少精力,最后证明根本就不是软件原因。另外能不能偷偷私信跟我说下是哪家,我最近也在考虑加购个4080S 32G来着,也在京东上看,就大勤,深图师两家。大勤我问了是7天内质量问题免费换新,深图师是说15天内退换,按你这个时间,是后面这家?
-
@icyliving 兄弟,该换就换啊。我之前故障的那张4090 48G,三次故障都是在运行comfyui大概二三十小时后出故障,有时候掉驱动就一直不行了,有时候关机一阵子后冷启动了正常,正常之后用OCCT跑100%显存测试,或者GPU 100%负载测试,测个半小时也不出问题,用furymark跑也跑不出问题。但是再跑comfyui,显存加载到近100%,某个运算过程就出错了。这种卡不要消耗自己精力去验证是不是自己的软件环境问题。要是有个其他卡能测出来不是自己的软件问题就别纠结了,赶紧换。不换到时候修,像我之前一样修个四次,两个月才修好,很麻烦的。我后面第三次故障,故障了换上原厂版本4080S 16G不出问题,就返修了。之前每次故障后还不断排查自己软件问题,系统重装了两次,驱动不知道换了多少个版本,花了不少精力,最后证明根本就不是软件原因。另外能不能偷偷私信跟我说下是哪家,我最近也在考虑加购个4080S 32G来着,也在京东上看,就大勤,深图师两家。大勤我问了是7天内质量问题免费换新,深图师是说15天内退换,按你这个时间,是后面这家?
-
我那时候的故障现象就是掉驱动,蓝屏,显卡一直维持在故障时候的功率一直卡在那,不去关它就一直这个功率也不关机。 硬件故障可能各种各样,你看老特的视频里,他好像是某个运算一直出错。这个魔改卡正常情况下基本不挑驱动和环境,出故障基本就是硬件了
-
@icyliving 赶快换修是正解。
-
@wop 我让hermes查了显卡默认配置,显示是比官方的默认频率高的。
这是hermes读的显卡VBIOS的数据。
【VBIOS 极限(驱动报告 Max Clocks)】- 核心 Max:3105 MHz ← 魔改超频 VBIOS
- 显存 Max:11501 MHz(= 官方规格,GDDR6X 23Gbps,没动)
【对照官方 RTX 4080 SUPER】
- 官方 boost:2550 MHz
- 这张卡:3105 MHz,高出 22%
@icyliving 用微星小飞机压到官方默认频率使用看看
-
@Hao-Wu 这个卡应该不挑驱动。我插上主板之后,都是自动识别的。。但是我在问ai的时候,ai说nvidia有两种驱动,一种是开源的open driver,一种是闭源驱动(proprietary driver),说是闭源驱动可能能解决我上边报的GSP error问题。。目前ubuntu上自动安装的都是开源驱动。。我没太多经验。。。我在想,不管三七二十一,先换卡再说。。。
@icyliving 完全不用折腾驱动,正常的卡随便驱动版本都不会有问题,出问题的驱动怎么折腾都没用浪费时间而已
-
@icyliving 完全不用折腾驱动,正常的卡随便驱动版本都不会有问题,出问题的驱动怎么折腾都没用浪费时间而已
-
@icyliving 用微星小飞机压到官方默认频率使用看看
-
@icyliving 赶快换修是正解。
@williamlouis 感谢版主回复,已听从各位建议,先换货再说。
-
@williamlouis 感谢版主回复,已听从各位建议,先换货再说。
@icyliving 能说说在哪买的么? 是咸鱼, 还是淘宝, 是小店还是评分很高的大店? 有没有看过用户评价?
-
我的4080s 32g 三风扇版,2个月前闲鱼买的,倒是一直挺好的,发热和噪音感觉都能接受,不过自己就是随便玩票一下,偶尔跑个几十分钟的,没有长时间高强度使用过。