跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
I

icyliving

@icyliving
取消关注 关注
关于
帖子
12
主题
2
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
    I icyliving

    @williamlouis 感谢版主回复,已听从各位建议,先换货再说。

    AI硬件 rtx4080s llama.cpp

  • 新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
    I icyliving

    @wop 这个还没试,我先申请换货了,等收到后,我打算限一下功率,我是在ubuntu上用的,现在经常能顶到320w左右的功率上限,我后边考虑限到290w用。

    AI硬件 rtx4080s llama.cpp

  • 新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
    I icyliving

    @Hao-Wu 说的有道理,已经申请换货。

    AI硬件 rtx4080s llama.cpp

  • 新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
    I icyliving

    @wop 我让hermes查了显卡默认配置,显示是比官方的默认频率高的。

    这是hermes读的显卡VBIOS的数据。
    【VBIOS 极限(驱动报告 Max Clocks)】

    • 核心 Max:3105 MHz ← 魔改超频 VBIOS
    • 显存 Max:11501 MHz(= 官方规格,GDDR6X 23Gbps,没动)

    【对照官方 RTX 4080 SUPER】

    • 官方 boost:2550 MHz
    • 这张卡:3105 MHz,高出 22%
    AI硬件 rtx4080s llama.cpp

  • 新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
    I icyliving

    @terry 多谢版主回复。。。我想不管三七二十一,先换卡再说,退是不能退了。。

    AI硬件 rtx4080s llama.cpp

  • 新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
    I icyliving

    @Hao-Wu 这个卡应该不挑驱动。我插上主板之后,都是自动识别的。。但是我在问ai的时候,ai说nvidia有两种驱动,一种是开源的open driver,一种是闭源驱动(proprietary driver),说是闭源驱动可能能解决我上边报的GSP error问题。。目前ubuntu上自动安装的都是开源驱动。。我没太多经验。。。我在想,不管三七二十一,先换卡再说。。。

    AI硬件 rtx4080s llama.cpp

  • 新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
    I icyliving

    @Hao-Wu 感谢老哥回复和提供经验。我也是担心以后出问题,来来回回折腾。。。这家客服反馈不支持退货了,只同意换货,因为超过了七天。我私信你吧。

    AI硬件 rtx4080s llama.cpp

  • 新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
    I icyliving

    @Xuan-Giang-Ngo 就不说明说哪家了

    希望有大佬帮我看看啊,我真担心有硬件问题,后边再断断续续出问题的话,就比较烦人了。

    AI硬件 rtx4080s llama.cpp

  • 新买的RTX 4080s 32gb 显卡 运行llamacpp的时候,偶然报错无响应,求助
    I icyliving

    各位大佬,

    背景
    我在京东购入一张RTX 4080s 32gb的显卡,大概有一周时间了。
    刚回来做了基础的显存测试,没有报错就正常使用了。
    1cc7647e-623a-4d7f-a847-db98fecb79fa-image.jpeg

    机器是跟着站长的推荐配的X99,X99-AD3主板,64gb 内存。

    出错情况:
    昨晚(08/31)使用RTX 4080s 运行llamacpp Qwen 3.8-27B,使用中途 突然发现llamacpp 无响应。使用Nvidia-smi命令查看发现,RTX 4080s 显卡出现Error,无法恢复。

    Nvidia-smi 错误截图
    b9a8d220-ff75-4fa9-8dc7-7bb06fd39a56-image.jpeg

    使用hermes/deepseek 抓取了日志:
    57633fde-2766-4558-9e30-29ef9a281abb-image.jpeg

    补充系统信息:

    • 机器:AI 服务器 192.168.5.127(Ubuntu 24.04.4, Xeon E5-2686 v4 / 62GB / 双卡)
    • 目标显卡:RTX 4080 SUPER 32GB(Bus 0x04, Device ID 0x2702, 魔改 32GB 版)
    • 驱动:595.84 (open kernel), CUDA 13.2

    Hermes/deepseek的错误分析
    一、故障现象

    时间 事件
    21:11 系统开机,llama-server 自动启动(Qwen3.8-27-UD-XL,锁 4080 SUPER)
    21:33 正常运行,推理速度 40+ t/s
    21:56:08 任务 6600 启动,前 15 秒正常(40 t/s)
    21:57:03 内核检测 GPU1 心跳超时(差距 46s > 阈值 5.2s)
    21:57:33 Memory Subsystem Error detected + TLB 失效失败
    21:57:33 Xid 175:GSP RPC 超时(等待 75s 无响应),pid=2033 llama-server
    21:57:36 Xid 154:GPU recovery action → Reset Required
    21:59 服务强制取消任务,API 完全无响应
    22:00+ nvidia-smi 显示 4080:温度/功耗/风扇/时钟全部 ERR!,显存 27.3GB 冻结

    症状总结:llama-server 推理速度暴跌(40→1 t/s)后 GPU 完全挂死,显存无法释放,
    nvidia-smi --gpu-reset 报 Not Supported,唯一恢复手段是重启。

    二、根因分析

    证据链

    1. 内核日志:kgmmuCheckMemSubsysError: Memory Subsystem Error detected +
      kgmmuInvalidateTlb_GM107: TLB invalidation failed + GSP 心跳超时
    2. 最终错误:Xid 175 (GSP RPC Timeout) → Xid 154 (Reset Required)
    3. "Memory Subsystem Error" 出现在 GSP 超时之后,为连锁检测结果
    4. 历史记录:往次开机(8/27、8/30)GPU 均正常,无类似故障
    5. 驱动 595.84 open kernel(2026-06-10 构建,较新)

    判定

    • 显存硬件故障嫌疑较高(Memory Subsystem Error 字面指向),但需压测验证
    • 软件(驱动/GSP 固件)故障为次要嫌疑(Xid 175 是 GSP 固件无响应)
    • 排除项:无 PCIe AER/总线错误(排除供电链路)、无 ECC 记录(消费卡不支持 ECC)

    我做的额外测试
    1) 使用hermes/deepseek 进行了 memtest_vulkan,跑了20min显存测试,没有错误。
    2) 使用hermes/deepseek做了 GPU burn test(测核心),GPU能够跑满100%,功率达到满载 310w的样子,nvidia-smi显示的核心温度达到90℃,同时显卡发出响声(挺尖锐的声音,不是风扇的声音,感觉是不正常的声音),大概也就1-2min钟的样子,感觉不对劲,就手动停止了,没敢再接着测试。

    希望大佬帮忙解答的:

    1. 这个是不是硬件有故障?从hermes 分析来看,我担心大概率是硬件有故障。京东后台看显卡在 9/4之前支持换货,之后估计就只能维修了。。我考虑要不要换货。已经不支持退货了。。“退货”的选项已经不能点了。

    2)使用GPU burn test 测试显卡功率满载的时候,发出异常的响声(非风扇声音),这个正常吗?我感觉不太正常啊。

    感谢版主,各位大佬

    AI硬件 rtx4080s llama.cpp

  • H100 4卡 96*4显存,想做视频制作服务器
    I icyliving

    nb,,只能想想了

    AI音视频画图 nvidia 多卡部署 服务器

  • 京东的风魄Rtx 3080有人入手吗?
    I icyliving

    京东的风魄Rtx 3080有人入手吗?
    价格3200左右,性能和RTX3090比,低一点。感觉挺有性价比的,就是不知道靠不靠谱?
    我已经有一张RTX3090了,想再入一张3080。3090一半的价格,就可以多20 Gb的显存。感觉还是蛮划算的。

    AI硬件 rtx3080

  • 实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率
    I icyliving

    晚上回来试了下,确实有效。点赞。

    AI Agent hermes
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组