跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
I

icyliving

@icyliving
取消关注 关注
关于
帖子
12
主题
2
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
    I icyliving

    各位大佬,

    背景
    我在京东购入一张RTX 4080s 32gb的显卡,大概有一周时间了。
    刚回来做了基础的显存测试,没有报错就正常使用了。
    1cc7647e-623a-4d7f-a847-db98fecb79fa-image.jpeg

    机器是跟着站长的推荐配的X99,X99-AD3主板,64gb 内存。

    出错情况:
    昨晚(08/31)使用RTX 4080s 运行llamacpp Qwen 3.8-27B,使用中途 突然发现llamacpp 无响应。使用Nvidia-smi命令查看发现,RTX 4080s 显卡出现Error,无法恢复。

    Nvidia-smi 错误截图
    b9a8d220-ff75-4fa9-8dc7-7bb06fd39a56-image.jpeg

    使用hermes/deepseek 抓取了日志:
    57633fde-2766-4558-9e30-29ef9a281abb-image.jpeg

    补充系统信息:

    • 机器:AI 服务器 192.168.5.127(Ubuntu 24.04.4, Xeon E5-2686 v4 / 62GB / 双卡)
    • 目标显卡:RTX 4080 SUPER 32GB(Bus 0x04, Device ID 0x2702, 魔改 32GB 版)
    • 驱动:595.84 (open kernel), CUDA 13.2

    Hermes/deepseek的错误分析
    一、故障现象

    时间 事件
    21:11 系统开机,llama-server 自动启动(Qwen3.8-27-UD-XL,锁 4080 SUPER)
    21:33 正常运行,推理速度 40+ t/s
    21:56:08 任务 6600 启动,前 15 秒正常(40 t/s)
    21:57:03 内核检测 GPU1 心跳超时(差距 46s > 阈值 5.2s)
    21:57:33 Memory Subsystem Error detected + TLB 失效失败
    21:57:33 Xid 175:GSP RPC 超时(等待 75s 无响应),pid=2033 llama-server
    21:57:36 Xid 154:GPU recovery action → Reset Required
    21:59 服务强制取消任务,API 完全无响应
    22:00+ nvidia-smi 显示 4080:温度/功耗/风扇/时钟全部 ERR!,显存 27.3GB 冻结

    症状总结:llama-server 推理速度暴跌(40→1 t/s)后 GPU 完全挂死,显存无法释放,
    nvidia-smi --gpu-reset 报 Not Supported,唯一恢复手段是重启。

    二、根因分析

    证据链

    1. 内核日志:kgmmuCheckMemSubsysError: Memory Subsystem Error detected +
      kgmmuInvalidateTlb_GM107: TLB invalidation failed + GSP 心跳超时
    2. 最终错误:Xid 175 (GSP RPC Timeout) → Xid 154 (Reset Required)
    3. "Memory Subsystem Error" 出现在 GSP 超时之后,为连锁检测结果
    4. 历史记录:往次开机(8/27、8/30)GPU 均正常,无类似故障
    5. 驱动 595.84 open kernel(2026-06-10 构建,较新)

    判定

    • 显存硬件故障嫌疑较高(Memory Subsystem Error 字面指向),但需压测验证
    • 软件(驱动/GSP 固件)故障为次要嫌疑(Xid 175 是 GSP 固件无响应)
    • 排除项:无 PCIe AER/总线错误(排除供电链路)、无 ECC 记录(消费卡不支持 ECC)

    我做的额外测试
    1) 使用hermes/deepseek 进行了 memtest_vulkan,跑了20min显存测试,没有错误。
    2) 使用hermes/deepseek做了 GPU burn test(测核心),GPU能够跑满100%,功率达到满载 310w的样子,nvidia-smi显示的核心温度达到90℃,同时显卡发出响声(挺尖锐的声音,不是风扇的声音,感觉是不正常的声音),大概也就1-2min钟的样子,感觉不对劲,就手动停止了,没敢再接着测试。

    希望大佬帮忙解答的:

    1. 这个是不是硬件有故障?从hermes 分析来看,我担心大概率是硬件有故障。京东后台看显卡在 9/4之前支持换货,之后估计就只能维修了。。我考虑要不要换货。已经不支持退货了。。“退货”的选项已经不能点了。

    2)使用GPU burn test 测试显卡功率满载的时候,发出异常的响声(非风扇声音),这个正常吗?我感觉不太正常啊。

    感谢版主,各位大佬

    AI硬件 rtx4080s llama.cpp
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组