<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[[实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s]]></title><description><![CDATA[<p dir="auto">先说一下背景,本人80后,坐标上海,从2024年初开始用Claude总结会议纪要,写每周工作报告,到后来回邮件到后来用的越来越重.</p>
<p dir="auto">到今年7月的时候就发现20美金的Claude和20美金的Codex都不够用了,开始想要不要玩一玩本地模型,当时还不知道Terry和这个论坛,就通过Chat-GTP和Google来回对比花了3000不到买了块V100的洋垃圾,想着如果跑通了未来可以升级.</p>
<p dir="auto">没想到跑出了看起来似乎还不错的数字,这几天用下来感觉真的是能用了,加上Terry推荐的Harness,感觉Claude可以退掉了.</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/c8e6862c-8080-4881-971c-86e7c7b9717f.jpg" alt="7a18483ea1a96802b7b278e3a6ecddbd.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">这是买回来卡和显卡坞时候拍的照片</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/338ea90b-5eae-4a2a-87ee-e94b244faec7.jpg" alt="ccb505a4dd27b177311cbdd393163353.jpg" class=" img-fluid img-markdown" /></p>
<h3><strong>我本人对技术和编程一无所知下面这些话和图都是Harness整理,AI味有点重,,大家凑合看看.</strong></h3>
<p dir="auto"><img src="https://upload.lcz.me/uploads/cedb617e-6218-429b-9c79-0ad91019399f.png" alt="图1.png" class=" img-fluid img-markdown" /></p>
<h1></h1>
<p dir="auto"><strong>一、身份与规格：原厂 Tesla 信息完整</strong></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/331d2c52-9922-4b7e-ae74-2ba57e1f44ec.jpeg" alt="41a614a0-9244-42d4-92f4-c4d535f940b7-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">判断这张卡是原厂 Tesla 卡，依据就是这四项——它们同时出现在一张卡上，改卡很难伪造。</p>
<p dir="auto">外接链路：雷电口协商到 PCIe Gen3 x4。坞内供电是 2× PCIe 8-pin，额定 300 W，另有一路 CPU 8-pin 未使用。</p>
<p dir="auto"><strong><strong>二、显存频率 1107 MHz</strong>，落在 V100S 规格上<br />
用 PyTorch 测 14.21 GB 张量的读写：</strong></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/05104547-6cc5-4bda-b2f7-27702ad0fcec.jpeg" alt="9c9d8c36-a932-450f-b1f5-bfc62fd3c36e-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">1107 MHz 这个频率把这张卡归到了 V100S 规格，实测带宽也印证了这一点：984.5 GB/s 的纯读落在 1134 GB/s 理论值的 87%，是合理水平。另一个参照是 RTX 3090 的 936 GB/s，这张卡比它高。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/8f0662e2-3b2d-40aa-aa49-4c914c446a60.png" alt="图2.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">三、250 W 是硬件上限，满载全程没有降频</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/a4b534ff-5a54-4325-b7a2-ca73301f2aac.jpeg" alt="57bfe71b-981a-40e6-ab79-6112b2ebc76f-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">峰值 284.4 W 超过 250 W 上限，这是 GPU 功耗采样的瞬时超调，持续时间极短。三项降频原因全程显示 Not Active，说明没有因为功耗撞墙而降频。平均功耗 207.8 W 低于上限 42 W，250 W 这个额度平时用不满。</p>
<p dir="auto"><strong>四、软件配置：llama.cpp 10964 加 MTP 投机解码</strong></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/cc1079a2-502b-47ed-8085-178656ad0e0f.jpeg" alt="893f6642-5509-41eb-844b-f1d6cdec8e3d-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">每一组都真实重载模型，负载是同一份 7026 token 真实材料加同一提示词，seed 固定，避免单次抖动。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/a4e23817-1aaf-45d6-a606-c909c4db417b.png" alt="图3.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">5.1 草稿长度 n-max=5，解码提升 11.2%<br />
<img src="https://upload.lcz.me/uploads/0a56403a-5033-45c1-89ca-16ff2ebfccd3.jpeg" alt="28c2a0bc-d544-4013-a5f0-e0b8fa558c83-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">投机解码让草稿模型一次猜多个 token，n-max 是猜的长度。5 是甜点，8 开始回落——猜得越长，草稿本身出错概率越高，被主模型否决的浪费越多。</p>
<p dir="auto">5.2 批大小 16384/4096，预填充提升 30.7%<br />
<img src="https://upload.lcz.me/uploads/8c7fd3f5-c8b9-4716-954f-04af1a08ce50.jpeg" alt="4616347f-362b-47d8-8088-8550637db104-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">预填充是算力受限，加大批处理让 GPU 吃得更饱，这一组的收益比解码那一组更大。</p>
<p dir="auto">5.3 KV 缓存量化：无收益，未采纳</p>
<p dir="auto">--cache-type-k q8_0 --cache-type-v q8_0 跑出解码 73.2（对照 74.0），预填充 803.4（对照 806.7）。两项都略低，未采纳。</p>
<p dir="auto"><strong>六、一个必须写出来的错误：用通用提示词测出来的结论是反的</strong></p>
<p dir="auto">第一轮调参，我用「写一篇行业分析」这类通用提示词做基准，得出「n-max 越大越慢」的结论，差点把投机解码关掉。</p>
<p dir="auto">换成真实抽取负载（要求输出 FACT | 主题 | 内容 的结构化格式）重测，结论直接反转。</p>
<p dir="auto">原因在草稿接受率：</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/7cbda8e9-3347-4b0d-b6ca-278b48953745.jpeg" alt="b5fee81c-7c48-4489-b3ca-67991779286c-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">结构化抽取的输出格式高度可预测，草稿模型几乎每次都猜对；自由写作没有可预测的套路，草稿十次里错七次。同一张卡、同一个模型，差 2.2 倍。</p>
<p dir="auto">这条经验比任何一组参数都值钱：判断本地模型够不够快，必须用自己真实的负载去测，通用 benchmark 在这里会给出完全错误的结论。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/981ff6c8-dbd8-4490-8a6b-a73e2f8aa90b.png" alt="05_context_and_workload.png" class=" img-fluid img-markdown" /></p>
<p dir="auto"><strong>七、最终结果：解码 73.5 tok/s、预填充 857 tok/s</strong></p>
<p dir="auto">--ctx-size 65536   -b 16384   -ub 4096   -np 1<br />
--spec-type draft-mtp   --spec-draft-n-max 5</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/b617a57c-ed63-48a5-9ff0-d5bb030ba8b9.jpeg" alt="95d44b1d-a6a6-4c82-967b-4d4990166bfc-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/b9a96aae-4f61-4086-8cc2-4b01148c6cc2.png" alt="04_final_performance.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">九、我拿来做什么工作：</p>
<ol>
<li>
<p dir="auto">投研报告的资料抽取——几万字行业材料进去，输出结构化的数字登记表与事实表</p>
</li>
<li>
<p dir="auto">会议纪要提炼——录音转写稿进去，出主题、结论、行动项</p>
</li>
<li>
<p dir="auto">本地翻译——中英文材料互译</p>
</li>
</ol>
<p dir="auto">不跑 ComfyUI 生图，不做模型训练。负载以长文本读取和结构化输出为主，解码占七成、预填充占三成，正好是这张卡带宽优势能吃满的地方。</p>
<p dir="auto">写在最后</p>
<p dir="auto">先谢 Terry。DeepSeek Harness 这套东西是从你的 YouTube 频道看到的,还有很多需要向你和大家学习.</p>
<p dir="auto">作为一个小白现在似乎已经跑通了本地模型部署了,下一步肯定是无尽的硬件,软件折腾,时隔快20年再一次在论坛发帖,好多青少年时期"玩电脑"的回忆又涌现出来,岁月如梭,祝大家开心.</p>
]]></description><link>https://lcz.me/topic/1832</link><generator>RSS for Node</generator><lastBuildDate>Fri, 25 Sep 2026 20:36:00 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1832.rss" rel="self" type="application/rss+xml"/><pubDate>Sun, 20 Sep 2026 03:29:33 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s on Fri, 25 Sep 2026 08:22:23 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/4259dd53-f335-4065-9393-9f501326c1a9.jpeg" alt="image.jpeg" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/1b837e8b-fc7f-4c6e-8350-464151127d9b.png" alt="a54f607e040d9d23d6dba317d7f7a65c.png" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/c3c6dc35-dca3-431d-8ebc-2ae22f9d6e5a.jpeg" alt="image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">用Codex,Claude code,Deepseek Harness直接调用都很顺利,质量也不错,感觉自己省了好多钱,其实除了硬件也花了不少token,哈哈</p>
]]></description><link>https://lcz.me/post/20692</link><guid isPermaLink="true">https://lcz.me/post/20692</guid><dc:creator><![CDATA[guochaofacai]]></dc:creator><pubDate>Fri, 25 Sep 2026 08:22:23 GMT</pubDate></item><item><title><![CDATA[Reply to [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s on Tue, 22 Sep 2026 04:57:10 GMT]]></title><description><![CDATA[<p dir="auto">3000多，只做文字处理的话，能有这个速度，那是相当可以了呀。</p>
]]></description><link>https://lcz.me/post/19978</link><guid isPermaLink="true">https://lcz.me/post/19978</guid><dc:creator><![CDATA[koala]]></dc:creator><pubDate>Tue, 22 Sep 2026 04:57:10 GMT</pubDate></item><item><title><![CDATA[Reply to [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s on Mon, 21 Sep 2026 11:57:05 GMT]]></title><description><![CDATA[<p dir="auto">最好加下显卡实拍，先置顶。用对了的卡就是好卡。</p>
]]></description><link>https://lcz.me/post/19754</link><guid isPermaLink="true">https://lcz.me/post/19754</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Mon, 21 Sep 2026 11:57:05 GMT</pubDate></item><item><title><![CDATA[Reply to [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s on Sun, 20 Sep 2026 07:02:39 GMT]]></title><description><![CDATA[<p dir="auto">按你的情况（V100S 984 GB/s、雷电 Gen3 x4、长文本抽取+结构化输出、decode 占七成），先给结论：2 万以内没有跨代提升，williamlouis 那句「不如攒」在带宽口径上是对的。</p>
<ul>
<li>decode 的天花板就是显存带宽。V100S 约 984 GB/s，已经比 3090 的 936 高、接近 4090 的 1008。</li>
<li>2 万内能拿到的：4090 24G（约 1008）、3090 24G（936）、R9700 32G（约 640，反而更低）。都是换生态/换显存，t/s 基本原地踏步，24G 还比你现在的 32G 小。</li>
<li>要有感知的提升（1.5 倍以上）只有两档：RTX 5090 32G（约 1.79 TB/s）和二手 A100 40G PCIe（HBM2e 约 1.55 TB/s、40G、原生 BF16）。</li>
</ul>
<p dir="auto">两条都有硬门槛：</p>
<ul>
<li>5090 是 575W 台式卡，雷电坞喂不动，等于换整机 + ATX3.1 电源，2 万可能只够卡本身；好处是容量不变、速度翻倍，长文本抽取和 agent 长链都受益。</li>
<li>A100 40G 是被动散热服务器卡，要转接供电 + 涡轮风道，雷电坞做不了，同样要台式；sm_80 没有 FP8，你想要的 FP8/NVFP4 生态吃不到。A100 比 V100 强不少，但它是「半代 + 平台重建」，不是插上就用。</li>
</ul>
<p dir="auto">结论：你这套在长文本抽取上已经贴着带宽天花板，2 万换 4090/3090/R9700 是白花钱。要么攒到 5090 整机或二手 H100/机房退役卡，要么这钱先花在内存/存储/散热上。真要现在动手，只有 5090 值得考虑，前提是你愿意把雷电坞方案换成台式。</p>
]]></description><link>https://lcz.me/post/19502</link><guid isPermaLink="true">https://lcz.me/post/19502</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sun, 20 Sep 2026 07:02:39 GMT</pubDate></item><item><title><![CDATA[Reply to [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s on Sun, 20 Sep 2026 06:13:39 GMT]]></title><description><![CDATA[<p dir="auto">A100 参数有点水。看价格吧。怎么说也是升级了。<br />
比 V100 强了几倍。</p>
]]></description><link>https://lcz.me/post/19486</link><guid isPermaLink="true">https://lcz.me/post/19486</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Sun, 20 Sep 2026 06:13:39 GMT</pubDate></item><item><title><![CDATA[Reply to [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s on Sun, 20 Sep 2026 05:55:12 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/williamlouis" aria-label="Profile: williamlouis">@<bdi>williamlouis</bdi></a> A100是不是有机会先等到?</p>
]]></description><link>https://lcz.me/post/19481</link><guid isPermaLink="true">https://lcz.me/post/19481</guid><dc:creator><![CDATA[guochaofacai]]></dc:creator><pubDate>Sun, 20 Sep 2026 05:55:12 GMT</pubDate></item><item><title><![CDATA[Reply to [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s on Sun, 20 Sep 2026 05:30:57 GMT]]></title><description><![CDATA[<p dir="auto">目前就是最优解了。兄弟。2W 不如攒下来。等H100 或其他机房换代。<br />
现在的市场不是升级的好时机。</p>
]]></description><link>https://lcz.me/post/19477</link><guid isPermaLink="true">https://lcz.me/post/19477</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Sun, 20 Sep 2026 05:30:57 GMT</pubDate></item><item><title><![CDATA[Reply to [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s on Sun, 20 Sep 2026 05:11:13 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/xiaote" aria-label="Profile: Xiaote">@<bdi>Xiaote</bdi></a> 那以我的情况,现在的价格,2万块以内换什么卡呢?</p>
]]></description><link>https://lcz.me/post/19471</link><guid isPermaLink="true">https://lcz.me/post/19471</guid><dc:creator><![CDATA[guochaofacai]]></dc:creator><pubDate>Sun, 20 Sep 2026 05:11:13 GMT</pubDate></item><item><title><![CDATA[Reply to [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s on Sun, 20 Sep 2026 04:07:49 GMT]]></title><description><![CDATA[<p dir="auto">完美的实战记录。充分利用了洋垃圾Tesla V100 32G。<br />
也说明了，正确用法的重要性。</p>
]]></description><link>https://lcz.me/post/19455</link><guid isPermaLink="true">https://lcz.me/post/19455</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Sun, 20 Sep 2026 04:07:49 GMT</pubDate></item><item><title><![CDATA[Reply to [实测]洋垃圾Tesla V100 32G 挂雷电坞接笔记本，跑 Qwen3.8-27B：显存频率 1107 MHz，解码 73.5 tok/s on Sun, 20 Sep 2026 04:02:16 GMT]]></title><description><![CDATA[<p dir="auto">这篇的数是自洽的，能对上：</p>
<ul>
<li>V100S 的 HBM2 带宽约 1134 GB/s，纯读 984.5（87%）是合理水平；比 3090 的 936 高也对，V100S 就是靠 HBM2 吃饭。</li>
<li>雷电 Gen3 x4 对 decode 几乎无影响：decode 是权重带宽瓶颈，权重常驻 HBM，PCIe 只影响模型加载和 prompt 上传；prefill 857 t/s 也说明算力侧没被 x4 卡死（7k token 约 8s，长材料的时间主要花在 prefill）。</li>
<li>73.5 t/s 配 MTP 说得通：27B Q4 约 16GB，单次前向的带宽天花板 ≈ 1134/16 ≈ 71 t/s；投机解码一次前向验多个 token，接受长度 &gt;1 就能超过这个上限。n-max=5 是甜点、8 回落，也符合接受率随长度下降的规律。</li>
</ul>
<p dir="auto">两个还能再挖的点：</p>
<ol>
<li>把实际接受长度/命中率记下来（llama.cpp 的 spec 统计或日志），它才决定 MTP 的真实收益；+11% 说明接受长度刚过 1，还有调 draft 头的空间。</li>
<li>V100/V100S 是 Volta（sm_70），没有 BF16/FP8，KV q8_0 没收益正常；将来换卡再考虑 FP8。</li>
</ol>
<p dir="auto">结论：这张卡在你这种「长文本抽取 + 结构化输出、解码占七成」的负载上确实吃满了带宽优势；要跑 ComfyUI 或训练就没它什么事了。</p>
]]></description><link>https://lcz.me/post/19450</link><guid isPermaLink="true">https://lcz.me/post/19450</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sun, 20 Sep 2026 04:02:16 GMT</pubDate></item></channel></rss>