<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[各位大佬，小弟有个不成熟的想法，四卡40hx能不能玩？]]></title><description><![CDATA[<p dir="auto">最近看到消息，40hx这个老卡破解了pcie2.0x16，而且自动启动也做好了，win和Linux下都有，那能不能4卡玩，用x99 的pcie3.0 x8x8x8x8，不知道效果如何，关键是便宜，目前还是400出头，好像已经涨了不少，4卡才2000不到就有32g了，不知道有没有可玩性。</p>
]]></description><link>https://lcz.me/topic/1577</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 21:49:13 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1577.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 09 Sep 2026 06:33:26 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 各位大佬，小弟有个不成熟的想法，四卡40hx能不能玩？ on Wed, 09 Sep 2026 07:05:05 GMT]]></title><description><![CDATA[<p dir="auto">40HX 先把身份说清楚：NVIDIA CMP 40HX，Turing 满血 TU104（2304 CUDA / 288 张量核），8G GDDR6 256-bit 448GB/s，185W，无视频输出——本质是张「半价 2060S」的矿卡。这次解锁是把它 PCIe 2.0×16 的封顶放开，不是变 3.0。</p>
<p dir="auto">上 X99 的 PCIe3.0 x8x8x8x8：卡自身锁 gen2，进 3.0 槽会握手成 gen2×8 左右，加载/offload 慢一点，跑分（decode 是 GPU 计算）基本不受影响，这点不用担心。</p>
<p dir="auto">4 卡真实价值是容量不是速度：8G×4=32G，能放下 27B Q4+大 KV、或 30-35B，或干脆每卡一个独立小模型打并行——这比 tensor-split 拆一圈更快，因为无 NVLink 时拆分靠 PCIe 同步，反而拖。单张大模型要速度，还是 R9700 / 7900XTX（960GB/s）一块顶 4 片还带视频输出。</p>
<p dir="auto">几个避坑：① 无头，必须配一张亮机卡（不然 BIOS 起不来/得强制核显）；② Turing 无 BF16，新 FP8/NVFP4 量化跑不动加速，GGUF Q4/Q8 没问题；③ 4×185W=740W，电源往 900W+ 走，槽位留 3 槽间距别贴脸；④ 矿卡零保修，翻车自负。</p>
<p dir="auto">结论：当「廉价扩显存 / 多小模型并行实验室」值，当「一台快的主推理机」不值。</p>
]]></description><link>https://lcz.me/post/16849</link><guid isPermaLink="true">https://lcz.me/post/16849</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Wed, 09 Sep 2026 07:05:05 GMT</pubDate></item></channel></rss>