@williamlouis 感谢版主回复,已听从各位建议,先换货再说。
icyliving
-
新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助 -
新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助@wop 这个还没试,我先申请换货了,等收到后,我打算限一下功率,我是在ubuntu上用的,现在经常能顶到320w左右的功率上限,我后边考虑限到290w用。
-
新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助@Hao-Wu 说的有道理,已经申请换货。
-
新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助@wop 我让hermes查了显卡默认配置,显示是比官方的默认频率高的。
这是hermes读的显卡VBIOS的数据。
【VBIOS 极限(驱动报告 Max Clocks)】- 核心 Max:3105 MHz ← 魔改超频 VBIOS
- 显存 Max:11501 MHz(= 官方规格,GDDR6X 23Gbps,没动)
【对照官方 RTX 4080 SUPER】
- 官方 boost:2550 MHz
- 这张卡:3105 MHz,高出 22%
-
新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助@terry 多谢版主回复。。。我想不管三七二十一,先换卡再说,退是不能退了。。
-
新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助@Hao-Wu 这个卡应该不挑驱动。我插上主板之后,都是自动识别的。。但是我在问ai的时候,ai说nvidia有两种驱动,一种是开源的open driver,一种是闭源驱动(proprietary driver),说是闭源驱动可能能解决我上边报的GSP error问题。。目前ubuntu上自动安装的都是开源驱动。。我没太多经验。。。我在想,不管三七二十一,先换卡再说。。。
-
新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助@Hao-Wu 感谢老哥回复和提供经验。我也是担心以后出问题,来来回回折腾。。。这家客服反馈不支持退货了,只同意换货,因为超过了七天。我私信你吧。
-
新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助@Xuan-Giang-Ngo 就不说明说哪家了
希望有大佬帮我看看啊,我真担心有硬件问题,后边再断断续续出问题的话,就比较烦人了。
-
新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助各位大佬,
背景
我在京东购入一张RTX 4080s 32gb的显卡,大概有一周时间了。
刚回来做了基础的显存测试,没有报错就正常使用了。

机器是跟着站长的推荐配的X99,X99-AD3主板,64gb 内存。
出错情况:
昨晚(08/31)使用RTX 4080s 运行llamacpp Qwen 3.8-27B,使用中途 突然发现llamacpp 无响应。使用Nvidia-smi命令查看发现,RTX 4080s 显卡出现Error,无法恢复。Nvidia-smi 错误截图

使用hermes/deepseek 抓取了日志:

补充系统信息:
- 机器:AI 服务器 192.168.5.127(Ubuntu 24.04.4, Xeon E5-2686 v4 / 62GB / 双卡)
- 目标显卡:RTX 4080 SUPER 32GB(Bus 0x04, Device ID 0x2702, 魔改 32GB 版)
- 驱动:595.84 (open kernel), CUDA 13.2
Hermes/deepseek的错误分析
一、故障现象时间 事件 21:11 系统开机,llama-server 自动启动(Qwen3.8-27-UD-XL,锁 4080 SUPER) 21:33 正常运行,推理速度 40+ t/s 21:56:08 任务 6600 启动,前 15 秒正常(40 t/s) 21:57:03 内核检测 GPU1 心跳超时(差距 46s > 阈值 5.2s) 21:57:33 Memory Subsystem Error detected + TLB 失效失败 21:57:33 Xid 175:GSP RPC 超时(等待 75s 无响应),pid=2033 llama-server 21:57:36 Xid 154:GPU recovery action → Reset Required 21:59 服务强制取消任务,API 完全无响应 22:00+ nvidia-smi 显示 4080:温度/功耗/风扇/时钟全部 ERR!,显存 27.3GB 冻结 症状总结:llama-server 推理速度暴跌(40→1 t/s)后 GPU 完全挂死,显存无法释放,
nvidia-smi --gpu-reset报 Not Supported,唯一恢复手段是重启。二、根因分析
证据链
- 内核日志:
kgmmuCheckMemSubsysError: Memory Subsystem Error detected+
kgmmuInvalidateTlb_GM107: TLB invalidation failed+ GSP 心跳超时 - 最终错误:Xid 175 (GSP RPC Timeout) → Xid 154 (Reset Required)
- "Memory Subsystem Error" 出现在 GSP 超时之后,为连锁检测结果
- 历史记录:往次开机(8/27、8/30)GPU 均正常,无类似故障
- 驱动 595.84 open kernel(2026-06-10 构建,较新)
判定
- 显存硬件故障嫌疑较高(Memory Subsystem Error 字面指向),但需压测验证
- 软件(驱动/GSP 固件)故障为次要嫌疑(Xid 175 是 GSP 固件无响应)
- 排除项:无 PCIe AER/总线错误(排除供电链路)、无 ECC 记录(消费卡不支持 ECC)
我做的额外测试
1) 使用hermes/deepseek 进行了 memtest_vulkan,跑了20min显存测试,没有错误。
2) 使用hermes/deepseek做了 GPU burn test(测核心),GPU能够跑满100%,功率达到满载 310w的样子,nvidia-smi显示的核心温度达到90℃,同时显卡发出响声(挺尖锐的声音,不是风扇的声音,感觉是不正常的声音),大概也就1-2min钟的样子,感觉不对劲,就手动停止了,没敢再接着测试。希望大佬帮忙解答的:
- 这个是不是硬件有故障?从hermes 分析来看,我担心大概率是硬件有故障。京东后台看显卡在 9/4之前支持换货,之后估计就只能维修了。。我考虑要不要换货。已经不支持退货了。。“退货”的选项已经不能点了。
2)使用GPU burn test 测试显卡功率满载的时候,发出异常的响声(非风扇声音),这个正常吗?我感觉不太正常啊。
感谢版主,各位大佬
-
H100 4卡 96*4显存,想做视频制作服务器nb,,只能想想了
-
京东的风魄Rtx 3080有人入手吗?京东的风魄Rtx 3080有人入手吗?
价格3200左右,性能和RTX3090比,低一点。感觉挺有性价比的,就是不知道靠不靠谱?
我已经有一张RTX3090了,想再入一张3080。3090一半的价格,就可以多20 Gb的显存。感觉还是蛮划算的。 -
实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率晚上回来试了下,确实有效。点赞。