<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[闲置NUC+TB4 显卡坞+NVIDIA CMP 170HX 8GB 挖矿卡，能跑什么本地模型？]]></title><description><![CDATA[<p dir="auto">前几天逛易贝看到NVIDIA CMP 170HX 8GB 挖矿卡已经涨到2500刀，心血来潮搞了一张，想着拿来组个终端给我的台式机打个下手，24小时跑本地模型随时待命。<br />
原本打算再淘一些像X99和DDR3的128GB以上的二手货来组170HX的平台，后来越看越贵，又想上DDR4的，一算下来又得一千多刀。<br />
昨天翻了下自己的闲置破烂，发现自己还有一台Core Ultra 5 210H  16GB RAM（SSD 512GB）的迷你NUC，一个1000W老电源。脑袋灵光一闪，这不就差一个显卡坞就能把170HX跑起来了么，于是立刻就在亚马逊定了一个TB4 eGPU的显卡坞，挑的最便宜的169刀连雷电4的线都不带，不过我自己有雷电4的硬盘盒带线的。接着我就把NUC装了乌班图的系统为了给170HX解锁64GB显存，还用网线跟我的台式机做了互联，台式机5GB的有线网口连接NUC2.5GB的网口，测试速度降到了2.5GB，实测传输文件速度280+MB。目前台式机可以用RustDesk直接控制NUC，一个显示器，一套键鼠，控制两个终端，测试了一下用我台式机的Hermes+llama.cpp+Qwen3.8-27B-Uncensored-Q6_K直接控制NUC，发现效果还行，比想象的好。<br />
现在我的问题是，过两天矿卡和显卡坞都到了以后，假如说解锁一切顺利，NUC能带着矿卡跑起来了，那么它跑什么大小的模型才是甜点？适合长期待机的模式，因为目前NUC的DDR5内存只有16G，是否有必要加到32G？<br />
按我现在的组合模式，还有什么是需要注意和改进的？求各位大神指点一二！！！感谢！！！<br />
<img src="https://upload.lcz.me/uploads/162b86ff-b574-47f9-8eac-fe92b85e0101.jpg" alt="photo_2026-09-10_22-23-04.jpg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/1618</link><generator>RSS for Node</generator><lastBuildDate>Tue, 22 Sep 2026 23:54:44 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1618.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 11 Sep 2026 03:24:58 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 闲置NUC+TB4 显卡坞+NVIDIA CMP 170HX 8GB 挖矿卡，能跑什么本地模型？ on Sun, 13 Sep 2026 02:58:05 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E4%B9%9D%E9%97%A8%E5%A5%87%E4%BA%BA" aria-label="Profile: 九门奇人">@<bdi>九门奇人</bdi></a> X16解锁要加焊24颗电容，洛杉矶这华人修手机的100刀包焊好，这是百分百可以硬解锁的。难的是8GB版本解锁到64GB能稳定。这都是赌，寿命不考虑的，能稳定跑跑就是赢。</p>
]]></description><link>https://lcz.me/post/17721</link><guid isPermaLink="true">https://lcz.me/post/17721</guid><dc:creator><![CDATA[孤帆]]></dc:creator><pubDate>Sun, 13 Sep 2026 02:58:05 GMT</pubDate></item><item><title><![CDATA[Reply to 闲置NUC+TB4 显卡坞+NVIDIA CMP 170HX 8GB 挖矿卡，能跑什么本地模型？ on Sat, 12 Sep 2026 10:02:25 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E4%B9%9D%E9%97%A8%E5%A5%87%E4%BA%BA" aria-label="Profile: 九门奇人">@<bdi>九门奇人</bdi></a> PCIe x16 解锁就算为真，对这套的收益也有限，别为它加预算。</p>
<p dir="auto">单卡跑能装进 8G 的模型时，瓶颈是 HBM2e 带宽（约 1493 GB/s），不是 PCIe：加载慢是一次性的，decode 基本不吃 PCIe。真正吃 PCIe 的是多卡 TP/PP（每层都要卡间通信）和频繁换模型的场景。</p>
<p dir="auto">要确认：<code>lspci -vv</code> 看显卡那行的 <code>LnkSta</code>（协商宽度/速率），<code>nvidia-smi topo -m</code> 看拓扑。另外 NUC 走 TB4 显卡坞，那条链路本身就相当于 PCIe 3.0 x4，卡那一端解锁也解不了坞这端。</p>
]]></description><link>https://lcz.me/post/17544</link><guid isPermaLink="true">https://lcz.me/post/17544</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sat, 12 Sep 2026 10:02:25 GMT</pubDate></item><item><title><![CDATA[Reply to 闲置NUC+TB4 显卡坞+NVIDIA CMP 170HX 8GB 挖矿卡，能跑什么本地模型？ on Sat, 12 Sep 2026 08:59:43 GMT]]></title><description><![CDATA[<p dir="auto">听说170HX 的PCIX16也解锁了</p>
]]></description><link>https://lcz.me/post/17530</link><guid isPermaLink="true">https://lcz.me/post/17530</guid><dc:creator><![CDATA[九门奇人]]></dc:creator><pubDate>Sat, 12 Sep 2026 08:59:43 GMT</pubDate></item><item><title><![CDATA[Reply to 闲置NUC+TB4 显卡坞+NVIDIA CMP 170HX 8GB 挖矿卡，能跑什么本地模型？ on Fri, 11 Sep 2026 13:22:52 GMT]]></title><description><![CDATA[<p dir="auto">内存还要加，32G跑大模型入门，170hx显存大，不过基础内存还是要的。16G也不贵吧。</p>
]]></description><link>https://lcz.me/post/17337</link><guid isPermaLink="true">https://lcz.me/post/17337</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Fri, 11 Sep 2026 13:22:52 GMT</pubDate></item><item><title><![CDATA[Reply to 闲置NUC+TB4 显卡坞+NVIDIA CMP 170HX 8GB 挖矿卡，能跑什么本地模型？ on Fri, 11 Sep 2026 04:05:24 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E5%AD%A4%E5%B8%86" aria-label="Profile: 孤帆">@<bdi>孤帆</bdi></a> 你这套组合的思路是对的，但有几个硬边界最好在卡到手之前先知道。先说卡的底子，再说甜点和坑。</p>
<p dir="auto"><strong>一、CMP 170HX 的底子（决定它能干什么）</strong></p>
<ul>
<li>GA100 核心（A100 同芯的阉割版），4480 CUDA，250W，无显示输出、无 NVENC/NVDEC。</li>
<li>8GB HBM2e、4096-bit、<strong>1493 GB/s</strong> 带宽。这点最值钱：带宽跟 A100 同档，比任何消费卡都高。也就是说——只要权重装得进显存，它的 decode 速度会很好看。</li>
<li>解锁是真事，但别按 64GB 做预算：CMPUnlocker（<a href="http://github.com/amoghmunikote/cmpunlocker%EF%BC%89%E8%83%BD%E6%81%A2%E5%A4%8D%E8%A2%AB%E5%9B%BA%E4%BB%B6/OTP" rel="nofollow ugc">github.com/amoghmunikote/cmpunlocker）能恢复被固件/OTP</a> 锁掉的 SM 算力和 HBM2e 完整几何（8GB 型号对应 64GB、10GB 型号对应 80GB），但公开反馈里<strong>只有 40GB 被确认跑通</strong>。按 40GB 规划，64GB 当彩蛋。</li>
<li>解锁环境：内核 ≥ 6.6 + 打过补丁的 610.43.03 驱动（文档路径是 Ubuntu 22.04 系 / HiveOS）。你在 NUC 上装 Ubuntu 先 <code>uname -r</code> 确认内核够新；解锁完跑一次显存带宽测试确认拿到的是真货，别只看 nvidia-smi 报的数字。</li>
</ul>
<p dir="auto"><strong>二、TB4 显卡坞是这套的真瓶颈，但不是你可能担心的那个方向</strong></p>
<ul>
<li>TB4 隧道 = PCIe 3.0 x4，实际 3 GB/s 量级；卡自己的 HBM 是 1493 GB/s，差 500 倍。</li>
<li>推论一：<strong>权重必须全额常驻显存，绝对不能做 CPU offload</strong>。llama.cpp 的 <code>-ngl</code> 拉满，显存不够就退更小的模型或更低的量化，绝不要让它往主机内存溢——溢出去的那部分每 token 都要跨 TB4 走一遍，速度直接掉到个位数。</li>
<li>推论二：只要装得下，<strong>decode 完全不受 TB4 影响</strong>（计算在卡上闭环）。所以「NUC 当常驻推理机 + 台式机 Hermes 走 API 调它」这个架构没问题，2.5GbE 传 token 绰绰有余（280MB/s 对 JSON 是浪费）。唯一代价是加载慢：20GB 的 GGUF 走 3GB/s 大约 1-2 分钟，接受就行。</li>
</ul>
<p dir="auto"><strong>三、甜点模型（按解锁结果二选一）</strong></p>
<ul>
<li>解锁成功（按 40GB）：Qwen3.8-27B Q4/Q5（约 17-20GB）整只进卡 + 长上下文；或者 30B-A3B 一类 MoE Q4（约 18GB）配 100K+ 上下文。这就是这台机的甜点区，别去碰 70B。</li>
<li>解锁失败（8GB）：7-9B Q4/Q5（5-6GB），留 2GB 给 KV，16-32K 上下文很稳。8B 级别在 1493 GB/s 上会跑得非常快，正好匹配「24 小时待命小助手」这个定位。</li>
<li>一个提醒：GA100 没有 FP8，只有 FP16/BF16/INT8 tensor。量化走 Q4/Q5 GGUF 就行，别指望 MXFP4 那套 RDNA 玩法。</li>
</ul>
<p dir="auto"><strong>四、16G 内存要不要加到 32G</strong><br />
加，但不是为了速度。模型在显存里，系统内存只装 OS + runtime + KV，16G 勉强够；但 Ubuntu + Docker + 页面缓存 + 模型加载（mmap）在 16G 上容易换页，加到 32G 是最便宜的保险。顺便看一眼现在是不是单条 16G（单通道）——能用两条 16G 就别单条，CPU 侧（tokenize、采样）和以后跑容器都有区别。</p>
<p dir="auto"><strong>五、几个会踩的坑，按概率排序</strong></p>
<ol>
<li>供电：250W 的卡 + 169 刀的坞。便宜坞的常见问题是只给显卡 100-150W 或干脆没有 8pin——确认卡是从你那台 1000W 电源直接取电（坞上要有 PCIe 供电口），别靠坞自供。</li>
<li>散热：CMP 是按矿机风道设计的，很多二手是裸板或缺风扇。250W 24/7 必须有风道/风扇，机箱进风 ≤25℃，否则它会自己降频，你测出来的速度会莫名其妙地低。</li>
<li>接入：BIOS 开 Above 4G Decoding（能开 Resizable BAR 就开）；eGPU 首次接入要在 Linux 里授权（boltctl / 安全等级），否则 lspci 看得到却用不了。</li>
<li>稳定性：eGPU 掉链路会让 CUDA 直接报错。跑常驻服务建议开 nvidia-persistenced、关 runtime PM、别让主机休眠。</li>
<li>核显别浪费：210H 的核显可以用 Vulkan 跑小模型当第二条通道，需要轻活的时候不用占这张卡。</li>
</ol>
]]></description><link>https://lcz.me/post/17244</link><guid isPermaLink="true">https://lcz.me/post/17244</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Fri, 11 Sep 2026 04:05:24 GMT</pubDate></item></channel></rss>