4080S 32G到手运行40小时报错了,魔改卡到手一定要好好测试
-
@Hao-Wu 你的意思是, 连续满载运行了40小时么?
@johnnybegood 刚开始半个小时跑的furmark2 32G显存测试。 然后就开始comfyui处理任务,前面6小时停过几次用来调整任务,后续调整好就让一直批量跑处理任务,连续在跑了。
-
@johnnybegood 刚开始半个小时跑的furmark2 32G显存测试。 然后就开始comfyui处理任务,前面6小时停过几次用来调整任务,后续调整好就让一直批量跑处理任务,连续在跑了。
-
其实AMD 的r9700 32g生产力在linux下真的不错了,而且是全新质保3年的卡,视音频和大模型都可以无疼上。48g显存的也有W7900 48G才1.9w也是全新卡,慢点总比宕机好。软件问题有大模型其实很好解决,硬件问题deepseek也帮不到你
-
其实AMD 的r9700 32g生产力在linux下真的不错了,而且是全新质保3年的卡,视音频和大模型都可以无疼上。48g显存的也有W7900 48G才1.9w也是全新卡,慢点总比宕机好。软件问题有大模型其实很好解决,硬件问题deepseek也帮不到你
@freeman-gemmy AMD的卡即使在Linux下是不是能运行,但是运算速度会慢不少?
-
@Hao-Wu 哦如果comfyui的话那中间好像也有能休息的时候, 不算一直满载。 确实奇怪为什么前面压力测试没事, 后来突然就不行了。
-
那中间好像也有能休息的时候, 不算一直满载。 确实奇怪为什么前面压力测试
是的,因为任务是一个一个的,每个任务都会有加载内容到显存然后运算完再从显存内卸载内容的过程。再前处理后处理阶段也有用不到显存和GPU运算时间,可能运算时间占了九成。或许这样反复加载卸载过程对显存的读写要求是更高?更容易把问题暴露出来?大模型是一般完全加载到显存里面么,测试软件是不是也是完全加载到显存里面然后就不从显存里卸载了
@Hao-Wu 你最后这个问题问到点子上了,分开说。
-
大模型推理:显存够时权重是常驻的(llama.cpp/vLLM 加载后一直占着),不会每个任务卸载重载;KV cache 也常驻并随 token 增长,只有换模型或超上限才回收。所以它测的是"长时间稳定读取"——带宽压力大,但分配/释放很稳定。
-
ComfyUI:workflow 里 CLIP/UNet/VAE/ControlNet 是分阶段加载的,中间 latent 张量反复申请释放,模型切换还有换入换出。显存分配/释放的峰值和碎片化比纯推理高得多,供电也跟着反复起落。这种"反复分配 + 瞬态电流"比恒定满载更容易把显存颗粒虚焊、时序余量不足、12VHPWR 瞬态这些毛病逼出来。
-
为什么 Furmark/3DMark 反而没事:它们是恒定满载计算,很少做大规模显存分配/释放,也不一定让显存持续满带宽读写。所以"压测过了"不等于"实际任务稳"。
换货前先留证据(对商家也有用):
- 跑
memtest_vulkan(显存全量读写,最接近你说的场景)或 OCCT VRAM; - 同时开
nvidia-smi dmon -s puct,看报错瞬间是掉卡(进程里消失)、有 Xid(dmesg里 Xid 31/43/48 之类),还是只是 ComfyUI 报 OOM/算子错; - 记录那一刻的功耗/温度/时钟:功耗尖峰后瞬间掉卡更像供电,温度爬高后花屏更像显存/散热。
7 天内能换货是对的,别先自己拆。换回来照样按上面这套跑 24–48h 再决定留不留。
-
-
京东买的4080S 32G到手运行40小时comfyui的处理任务报错了
我之前买过4090 48G,并且维修过好几次,硬件故障的时候折腾过各种软件调试都没用,硬件没故障连续跑几周都不出错的。所以这次故障就直接联系商家换货了。好在故障出在7天内。希望换回来的能正常运行。
京东的这家的卡的做工,看起来是比我淘宝买的4090 48G的好,起码质检贴都贴了两张,器件也贴的规整。 代工厂也不是同一家,防拆贴等各种都不一样。
朋友们买这种魔改卡,到手一定要好好测试,满负荷测试个一个月没问题才好。过了退货期,包换期,到时候维修就很久了。据豆包说这种卡改装需要调显存时序什么的,工厂里出场测试可能没像实际运行那么高负载,就像有时候跑furmark, 3dmark都不出错,但是实际连续连续处理任务就容易出错。
可惜是没有32G显存类似的替代品,不然魔改卡真不是个让人省心的选择,我是之前修过,对这个卡的故障率有认知,但是故障了要换还是心里有点担心。担心下一张换来的卡还是要故障的话,换货退货又是麻烦。
我拿到之后,是拿了两个监控,一个对着屏幕,一个对着机箱里的显卡,一直录着。凌晨三点多出现故障。一般软件故障,comfyui会报错,硬件故障就查不出来。
-
@Hao-Wu 你最后这个问题问到点子上了,分开说。
-
大模型推理:显存够时权重是常驻的(llama.cpp/vLLM 加载后一直占着),不会每个任务卸载重载;KV cache 也常驻并随 token 增长,只有换模型或超上限才回收。所以它测的是"长时间稳定读取"——带宽压力大,但分配/释放很稳定。
-
ComfyUI:workflow 里 CLIP/UNet/VAE/ControlNet 是分阶段加载的,中间 latent 张量反复申请释放,模型切换还有换入换出。显存分配/释放的峰值和碎片化比纯推理高得多,供电也跟着反复起落。这种"反复分配 + 瞬态电流"比恒定满载更容易把显存颗粒虚焊、时序余量不足、12VHPWR 瞬态这些毛病逼出来。
-
为什么 Furmark/3DMark 反而没事:它们是恒定满载计算,很少做大规模显存分配/释放,也不一定让显存持续满带宽读写。所以"压测过了"不等于"实际任务稳"。
换货前先留证据(对商家也有用):
- 跑
memtest_vulkan(显存全量读写,最接近你说的场景)或 OCCT VRAM; - 同时开
nvidia-smi dmon -s puct,看报错瞬间是掉卡(进程里消失)、有 Xid(dmesg里 Xid 31/43/48 之类),还是只是 ComfyUI 报 OOM/算子错; - 记录那一刻的功耗/温度/时钟:功耗尖峰后瞬间掉卡更像供电,温度爬高后花屏更像显存/散热。
7 天内能换货是对的,别先自己拆。换回来照样按上面这套跑 24–48h 再决定留不留。
@Xiaote 还是大佬专业,说到了点子上,换回来我再用nvidia-smi dmon -s puct监控着。OOM,算子报错这些软件问题其实都会在控制台里面有纪录,都好解决的。就是这种硬件问题,根本查不出来。
另外这次报错,豆包教我用nvidia-smi -q查看了下报告,最终报告豆包分析说PCIE通道运行在GEN 1 X16上,而不是GEN 4 X16.
PCIe Generation
Max : 4
Current : 1
Device Current : 1
Device Max : 4
Host Max : 5
Link Width
Max : 16x
Current : 16xdeepseek说可能是魔改卡在长时间高负载下,供电模块出了问题不稳定,触发了系统保护机制。我的电源配的750W的长城金牌电源,功率是够的。
-
-
-
保持空间的温度是个很优秀的解法。
魔改卡的故障基本都是 显存高温开焊。 -
保持空间的温度是个很优秀的解法。
魔改卡的故障基本都是 显存高温开焊。@williamlouis 另外一个我不理解的就是, 焊锡在100多度为什么就能开焊?
-
@kos-or 我踩过坑了还再踩踩看,主要也是有主力卡在稳定运行了,这张卡作为额外的助力,有更好没有也行,所以即使出了故障也还算不怎么烦。要是再买张三万的4090 48G还过了包换期,那真是要挺焦虑的。我的主力4090 48G那张再之前维修的时候,淘宝店还清空宝贝了,就让我很担忧。现在用,就水平放置机箱,开放,开空调,开电风扇,GPU温度都压在70下,hotspot也在80度下用。这种卡不出问题的时候,相对那些贵卡,是相对经济又好用。
-
保持空间的温度是个很优秀的解法。
魔改卡的故障基本都是 显存高温开焊。 -
@williamlouis 另外一个我不理解的就是, 焊锡在100多度为什么就能开焊?
@johnnybegood 按照我以前了解的可靠性工程方面的知识,大概显卡升温降温的时候,焊点PCB芯片都有不同材料都有不同的膨胀系数,反复升温降温会导致不同材料的接触界面因为这个膨胀系数的不同产生细微裂缝,时间久了裂缝大了就形成了短路。然后就坏了。一般电子产品撑过一段时间的早期失效阶段(因为先天制造缺陷导致的)就进入服从指数分布的随机失效期。
像是魔改卡这种几十小时就出故障的,感觉就是出厂阶段没有做太好的老化测试,没有把这些早期失效阶段的剔除掉,导致再客户使用时出现这些故障。或者这种魔改卡本身需要匹配显存时序什么的,匹配不好就根部不符合正常的电子产品寿命分布了。
-
@johnnybegood 按照我以前了解的可靠性工程方面的知识,大概显卡升温降温的时候,焊点PCB芯片都有不同材料都有不同的膨胀系数,反复升温降温会导致不同材料的接触界面因为这个膨胀系数的不同产生细微裂缝,时间久了裂缝大了就形成了短路。然后就坏了。一般电子产品撑过一段时间的早期失效阶段(因为先天制造缺陷导致的)就进入服从指数分布的随机失效期。
像是魔改卡这种几十小时就出故障的,感觉就是出厂阶段没有做太好的老化测试,没有把这些早期失效阶段的剔除掉,导致再客户使用时出现这些故障。或者这种魔改卡本身需要匹配显存时序什么的,匹配不好就根部不符合正常的电子产品寿命分布了。
-
@Hao-Wu 我前一阵也关注过一阵魔改卡, 有的贵一点的, 会标注“工厂一次性流焊” , 这样就稳妥一些吧, 应该是工厂的机器焊接的。 如果没写的, 有可能就是小作坊手工弄的?
@johnnybegood 我在京东买的的肯定时工厂贴片机含的,手工焊接的没那么好的。就现在深圳那边的制造水平,板子本身可能很少有小作坊手工焊,很多器件也都非常小。毕竟有贴片机,回流焊的线的代工厂很多,小代工厂也可以做到。只有显存和芯片可能有些是手工焊上去的。就像B站的张哥修显卡,靓女修显卡,基本都是买成品板子来改装魔改卡,只搬芯片和显存。我之前维修,他们最后也是直接换了个板子
-
你看到说的工厂其实相对于 二线显卡厂家 都是小作坊。更不要和一线品牌去比较啦。华硕 技嘉这些品牌的生产线实力建议网络搜索了解。
-
你看到说的工厂其实相对于 二线显卡厂家 都是小作坊。更不要和一线品牌去比较啦。华硕 技嘉这些品牌的生产线实力建议网络搜索了解。
@williamlouis 这些跟二线肯定没法比,代工的肯定三四线小厂了,代工厂其实查得到,两个的注册资本也就不到100万
-
@Xiaote 还是大佬专业,说到了点子上,换回来我再用nvidia-smi dmon -s puct监控着。OOM,算子报错这些软件问题其实都会在控制台里面有纪录,都好解决的。就是这种硬件问题,根本查不出来。
另外这次报错,豆包教我用nvidia-smi -q查看了下报告,最终报告豆包分析说PCIE通道运行在GEN 1 X16上,而不是GEN 4 X16.
PCIe Generation
Max : 4
Current : 1
Device Current : 1
Device Max : 4
Host Max : 5
Link Width
Max : 16x
Current : 16xdeepseek说可能是魔改卡在长时间高负载下,供电模块出了问题不稳定,触发了系统保护机制。我的电源配的750W的长城金牌电源,功率是够的。
先别急着给卡判死刑,nvidia-smi 那个 Gen1 大概率是空闲降速,不一定是链路坏了。
RTX 40 系在空闲/低负载时会把 PCIe 链路降到 Gen1 省电(ASPM/L1),负载上来再协商回 Gen4。要区分两种情况:空闲时 Current=1、一跑负载就回 Gen4,属正常;负载中也一直卡在 Gen1,才是真降级。
验证要在跑着负载时看:
nvidia-smi --query-gpu=pcie.link.gen.current,pcie.link.gen.max,pcie.link.width.current --format=csv -l 1如果负载下仍是 Gen1,基本是链路训练/信号完整性问题,不是核心坏:
- lspci -vv -s <BDF> 对比 LnkCap 和 LnkSta,同时看 Correctable/Fatal 计数;
- dmesg | grep -iE 'pcie|aer' 看有没有 downgrade 或 AER 报错;
- 魔改/矿卡常见诱因是金手指氧化、插槽积灰、延长线质量、反复热循环后接触不良。先用橡皮擦金手指 + 无水酒精清洁,直插主板别走转接,BIOS 里把该槽手动锁 Gen4、关 ASPM 再试。
两点纠正:
- 单卡推理权重全在显存里,decode 几乎不吃 PCIe。Gen1 x16 约 4GB/s 也不至于跑出 OOM 或算子报错,它和这次报错更可能是两件独立的事。
- 750W 长城金牌带单张 4080S 是够的。真要是供电/接触问题,通常表现为掉卡、重启或 Xid 79/52/62,而不是链路单纯降到 Gen1。豆包那个"供电触发保护"目前没有证据。
建议两条线分开记:链路这边看 lspci/dmesg,计算这边继续 nvidia-smi dmon + dmesg 抓 Xid,先把报错原文和 Xid 号拿到,再判断是硬件还是软件。
-
先别急着给卡判死刑,nvidia-smi 那个 Gen1 大概率是空闲降速,不一定是链路坏了。
RTX 40 系在空闲/低负载时会把 PCIe 链路降到 Gen1 省电(ASPM/L1),负载上来再协商回 Gen4。要区分两种情况:空闲时 Current=1、一跑负载就回 Gen4,属正常;负载中也一直卡在 Gen1,才是真降级。
验证要在跑着负载时看:
nvidia-smi --query-gpu=pcie.link.gen.current,pcie.link.gen.max,pcie.link.width.current --format=csv -l 1如果负载下仍是 Gen1,基本是链路训练/信号完整性问题,不是核心坏:
- lspci -vv -s <BDF> 对比 LnkCap 和 LnkSta,同时看 Correctable/Fatal 计数;
- dmesg | grep -iE 'pcie|aer' 看有没有 downgrade 或 AER 报错;
- 魔改/矿卡常见诱因是金手指氧化、插槽积灰、延长线质量、反复热循环后接触不良。先用橡皮擦金手指 + 无水酒精清洁,直插主板别走转接,BIOS 里把该槽手动锁 Gen4、关 ASPM 再试。
两点纠正:
- 单卡推理权重全在显存里,decode 几乎不吃 PCIe。Gen1 x16 约 4GB/s 也不至于跑出 OOM 或算子报错,它和这次报错更可能是两件独立的事。
- 750W 长城金牌带单张 4080S 是够的。真要是供电/接触问题,通常表现为掉卡、重启或 Xid 79/52/62,而不是链路单纯降到 Gen1。豆包那个"供电触发保护"目前没有证据。
建议两条线分开记:链路这边看 lspci/dmesg,计算这边继续 nvidia-smi dmon + dmesg 抓 Xid,先把报错原文和 Xid 号拿到,再判断是硬件还是软件。