4080S 32G到手运行40小时报错了,魔改卡到手一定要好好测试
-
保持空间的温度是个很优秀的解法。
魔改卡的故障基本都是 显存高温开焊。 -
@williamlouis 另外一个我不理解的就是, 焊锡在100多度为什么就能开焊?
@johnnybegood 按照我以前了解的可靠性工程方面的知识,大概显卡升温降温的时候,焊点PCB芯片都有不同材料都有不同的膨胀系数,反复升温降温会导致不同材料的接触界面因为这个膨胀系数的不同产生细微裂缝,时间久了裂缝大了就形成了短路。然后就坏了。一般电子产品撑过一段时间的早期失效阶段(因为先天制造缺陷导致的)就进入服从指数分布的随机失效期。
像是魔改卡这种几十小时就出故障的,感觉就是出厂阶段没有做太好的老化测试,没有把这些早期失效阶段的剔除掉,导致再客户使用时出现这些故障。或者这种魔改卡本身需要匹配显存时序什么的,匹配不好就根部不符合正常的电子产品寿命分布了。
-
@johnnybegood 按照我以前了解的可靠性工程方面的知识,大概显卡升温降温的时候,焊点PCB芯片都有不同材料都有不同的膨胀系数,反复升温降温会导致不同材料的接触界面因为这个膨胀系数的不同产生细微裂缝,时间久了裂缝大了就形成了短路。然后就坏了。一般电子产品撑过一段时间的早期失效阶段(因为先天制造缺陷导致的)就进入服从指数分布的随机失效期。
像是魔改卡这种几十小时就出故障的,感觉就是出厂阶段没有做太好的老化测试,没有把这些早期失效阶段的剔除掉,导致再客户使用时出现这些故障。或者这种魔改卡本身需要匹配显存时序什么的,匹配不好就根部不符合正常的电子产品寿命分布了。
-
@Hao-Wu 我前一阵也关注过一阵魔改卡, 有的贵一点的, 会标注“工厂一次性流焊” , 这样就稳妥一些吧, 应该是工厂的机器焊接的。 如果没写的, 有可能就是小作坊手工弄的?
@johnnybegood 我在京东买的的肯定时工厂贴片机含的,手工焊接的没那么好的。就现在深圳那边的制造水平,板子本身可能很少有小作坊手工焊,很多器件也都非常小。毕竟有贴片机,回流焊的线的代工厂很多,小代工厂也可以做到。只有显存和芯片可能有些是手工焊上去的。就像B站的张哥修显卡,靓女修显卡,基本都是买成品板子来改装魔改卡,只搬芯片和显存。我之前维修,他们最后也是直接换了个板子
-
你看到说的工厂其实相对于 二线显卡厂家 都是小作坊。更不要和一线品牌去比较啦。华硕 技嘉这些品牌的生产线实力建议网络搜索了解。
-
你看到说的工厂其实相对于 二线显卡厂家 都是小作坊。更不要和一线品牌去比较啦。华硕 技嘉这些品牌的生产线实力建议网络搜索了解。
@williamlouis 这些跟二线肯定没法比,代工的肯定三四线小厂了,代工厂其实查得到,两个的注册资本也就不到100万
-
@Xiaote 还是大佬专业,说到了点子上,换回来我再用nvidia-smi dmon -s puct监控着。OOM,算子报错这些软件问题其实都会在控制台里面有纪录,都好解决的。就是这种硬件问题,根本查不出来。
另外这次报错,豆包教我用nvidia-smi -q查看了下报告,最终报告豆包分析说PCIE通道运行在GEN 1 X16上,而不是GEN 4 X16.
PCIe Generation
Max : 4
Current : 1
Device Current : 1
Device Max : 4
Host Max : 5
Link Width
Max : 16x
Current : 16xdeepseek说可能是魔改卡在长时间高负载下,供电模块出了问题不稳定,触发了系统保护机制。我的电源配的750W的长城金牌电源,功率是够的。
先别急着给卡判死刑,nvidia-smi 那个 Gen1 大概率是空闲降速,不一定是链路坏了。
RTX 40 系在空闲/低负载时会把 PCIe 链路降到 Gen1 省电(ASPM/L1),负载上来再协商回 Gen4。要区分两种情况:空闲时 Current=1、一跑负载就回 Gen4,属正常;负载中也一直卡在 Gen1,才是真降级。
验证要在跑着负载时看:
nvidia-smi --query-gpu=pcie.link.gen.current,pcie.link.gen.max,pcie.link.width.current --format=csv -l 1如果负载下仍是 Gen1,基本是链路训练/信号完整性问题,不是核心坏:
- lspci -vv -s <BDF> 对比 LnkCap 和 LnkSta,同时看 Correctable/Fatal 计数;
- dmesg | grep -iE 'pcie|aer' 看有没有 downgrade 或 AER 报错;
- 魔改/矿卡常见诱因是金手指氧化、插槽积灰、延长线质量、反复热循环后接触不良。先用橡皮擦金手指 + 无水酒精清洁,直插主板别走转接,BIOS 里把该槽手动锁 Gen4、关 ASPM 再试。
两点纠正:
- 单卡推理权重全在显存里,decode 几乎不吃 PCIe。Gen1 x16 约 4GB/s 也不至于跑出 OOM 或算子报错,它和这次报错更可能是两件独立的事。
- 750W 长城金牌带单张 4080S 是够的。真要是供电/接触问题,通常表现为掉卡、重启或 Xid 79/52/62,而不是链路单纯降到 Gen1。豆包那个"供电触发保护"目前没有证据。
建议两条线分开记:链路这边看 lspci/dmesg,计算这边继续 nvidia-smi dmon + dmesg 抓 Xid,先把报错原文和 Xid 号拿到,再判断是硬件还是软件。
-
先别急着给卡判死刑,nvidia-smi 那个 Gen1 大概率是空闲降速,不一定是链路坏了。
RTX 40 系在空闲/低负载时会把 PCIe 链路降到 Gen1 省电(ASPM/L1),负载上来再协商回 Gen4。要区分两种情况:空闲时 Current=1、一跑负载就回 Gen4,属正常;负载中也一直卡在 Gen1,才是真降级。
验证要在跑着负载时看:
nvidia-smi --query-gpu=pcie.link.gen.current,pcie.link.gen.max,pcie.link.width.current --format=csv -l 1如果负载下仍是 Gen1,基本是链路训练/信号完整性问题,不是核心坏:
- lspci -vv -s <BDF> 对比 LnkCap 和 LnkSta,同时看 Correctable/Fatal 计数;
- dmesg | grep -iE 'pcie|aer' 看有没有 downgrade 或 AER 报错;
- 魔改/矿卡常见诱因是金手指氧化、插槽积灰、延长线质量、反复热循环后接触不良。先用橡皮擦金手指 + 无水酒精清洁,直插主板别走转接,BIOS 里把该槽手动锁 Gen4、关 ASPM 再试。
两点纠正:
- 单卡推理权重全在显存里,decode 几乎不吃 PCIe。Gen1 x16 约 4GB/s 也不至于跑出 OOM 或算子报错,它和这次报错更可能是两件独立的事。
- 750W 长城金牌带单张 4080S 是够的。真要是供电/接触问题,通常表现为掉卡、重启或 Xid 79/52/62,而不是链路单纯降到 Gen1。豆包那个"供电触发保护"目前没有证据。
建议两条线分开记:链路这边看 lspci/dmesg,计算这边继续 nvidia-smi dmon + dmesg 抓 Xid,先把报错原文和 Xid 号拿到,再判断是硬件还是软件。
-
@Xiaote AI 无法观测硬件在现实中的具体现象。建议节省算力。不要参与硬件故障分析。浪费token。
-
其实AMD 的r9700 32g生产力在linux下真的不错了,而且是全新质保3年的卡,视音频和大模型都可以无疼上。48g显存的也有W7900 48G才1.9w也是全新卡,慢点总比宕机好。软件问题有大模型其实很好解决,硬件问题deepseek也帮不到你
-
@johnnybegood 按照我以前了解的可靠性工程方面的知识,大概显卡升温降温的时候,焊点PCB芯片都有不同材料都有不同的膨胀系数,反复升温降温会导致不同材料的接触界面因为这个膨胀系数的不同产生细微裂缝,时间久了裂缝大了就形成了短路。然后就坏了。一般电子产品撑过一段时间的早期失效阶段(因为先天制造缺陷导致的)就进入服从指数分布的随机失效期。
像是魔改卡这种几十小时就出故障的,感觉就是出厂阶段没有做太好的老化测试,没有把这些早期失效阶段的剔除掉,导致再客户使用时出现这些故障。或者这种魔改卡本身需要匹配显存时序什么的,匹配不好就根部不符合正常的电子产品寿命分布了。
-