<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[没苦硬吃！！3090带着小弟跑Qwen3.8-Flash-Next IQ4双卡实测]]></title><description><![CDATA[<blockquote>
<p dir="auto">测试日期：2026-08-29<br />
llama.cpp 版本：b10676 / commit ba29f94da（master HEAD）</p>
</blockquote>
<h2>结论先放</h2>
<p dir="auto">把 Qwen3.8-Flash-Next（<code>Uncensored-IQ4_XS</code>，97 GB，176B 参数）放在RTX 3090 24G带 RTX 3070 8G 这种非对称双卡上，用 llama.cpp 最新 master build（含 qwen4exp 架构支持），实测四档 context 下来：</p>
<ul>
<li>Prefill：4K 301 t/s → 16K 266 t/s → 32K 244 t/s → 64K 280 t/s</li>
<li>Decode：4K 26.1 t/s → 16K 23.2 t/s → 32K 19.6 t/s → 64K 15.2 t/s</li>
<li>Wall time：4K 灌入+生成 16 秒，64K 灌入+生成 238 秒</li>
<li>KV Cache 精度：4K / 16K 用 q8_0；32K / 64K 用 q4_0（显存装不下 q8_0）</li>
<li>整体判断：在没有 R9700 / 5090 / 4090 的前提下，这台机器能把 176B 量级 MoE + sparse-attn 模型扛住到 64K context；本地日常使用（写代码、聊问答、做长摘要）完全 OK。</li>
</ul>
<h2>1. 测试环境</h2>
<h3>1.1 硬件一览</h3>
<p dir="auto"><img src="https://upload.lcz.me/uploads/3a7daa04-4638-4db9-af8c-d6664c56aa86.jpg" alt="微信图片_20260829130418_9_5.jpg" class=" img-fluid img-markdown" /></p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>项目</td>
<td>型号 / 规格</td>
</tr>
<tr>
<td>CPU</td>
<td>AMD Ryzen 9 3950X（16C / 32T）</td>
</tr>
<tr>
<td>内存</td>
<td>64 GB （实际可用约 60 GB）</td>
</tr>
<tr>
<td>GPU 0</td>
<td>NVIDIA GeForce RTX 3070（8 GB，sm_86，PCIe 4.0 x16 @ x16）</td>
</tr>
<tr>
<td>GPU 1</td>
<td>NVIDIA GeForce RTX 3090（24 GB，sm_86，PCIe 4.0 x16 @ x16）</td>
</tr>
<tr>
<td>总显存</td>
<td>32 GB（3070 + 3090）</td>
</tr>
<tr>
<td>存储</td>
<td>系统 NVMe 4TB</td>
</tr>
<tr>
<td>系统</td>
<td>Ubuntu 22.04.5 LTS（kernel 6.8.0-138-generic）</td>
</tr>
<tr>
<td>NVIDIA 驱动</td>
<td>580.178.04（CUDA 13.0）</td>
</tr>
<tr>
<td>CUDA toolkit</td>
<td>nvcc 12.8.93（驱动兼容构建）</td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto">这里要诚实说一句：这是非常不均衡的双卡 —— 一张 8G、一张 24G；而且不是 NVLink。MoE 大模型在两张卡之间按层切的时候，跨卡通信会变成主要瓶颈。但至少比纯 CPU 跑 176B 模型要快很多倍。也试过单张3090加内存跑，真的跑不动，我说的是可以跑起来， 但是跑时间长了就OOM死掉了。</p>
</blockquote>
<h3>1.2 软件</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>项目</td>
<td>版本</td>
</tr>
<tr>
<td>llama.cpp</td>
<td>b10676 / commit ba29f94da（master HEAD，2026-08-28 后）</td>
</tr>
<tr>
<td>CUDA backend</td>
<td>sm_86（RTX 3070 / 3090）</td>
</tr>
<tr>
<td>cuDNN</td>
<td>驱动自带</td>
</tr>
<tr>
<td>Backend</td>
<td><a href="http://ggml-cuda.so" rel="nofollow ugc">ggml-cuda.so</a> 0.22.0</td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto">模型 <code>qwen4exp</code> 架构在 c1d0e7a00 之前的 llama.cpp 上会直接报 <code>unknown model architecture: 'qwen4exp'</code>，必须升级到 b10660 之后、最好用 master latest。本次实测就是在自己本地源码重建 ba29f94da 之后做的，<a href="http://libllama.so" rel="nofollow ugc">libllama.so</a> 含 37 个 <code>qwen4exp</code> 相关符号。</p>
</blockquote>
<p dir="auto"><img src="https://upload.lcz.me/uploads/7efb1af8-a3a3-47dd-8e19-d51f2c9b0cd7.png" alt="Screenshot from 2026-08-29 11-03-07.png" class=" img-fluid img-markdown" /></p>
<h3>1.3 模型</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>项目</td>
<td>规格</td>
</tr>
<tr>
<td>模型</td>
<td>Qwen3.8-Flash-Next</td>
</tr>
<tr>
<td>量化</td>
<td>IQ4_XS（4.25 bpw）</td>
</tr>
<tr>
<td>文件大小</td>
<td>97 GB（3 个 GGUF 分片：44.7 GB + 44.7 GB + 7.9 GB）</td>
</tr>
<tr>
<td>参数量</td>
<td>176.94 B（n_params=176943899520）</td>
</tr>
<tr>
<td>架构</td>
<td>qwen4exp（sparse attention + MoE + MTP）</td>
</tr>
<tr>
<td>词表</td>
<td>n_vocab=248320</td>
</tr>
<tr>
<td>嵌入维度</td>
<td>n_embd=2560</td>
</tr>
</tbody>
</table>
<h2>2. 实测结果</h2>
<h3>2.1 主表：4K / 16K / 32K / 64K KV Cache 下的 Prefill 与 Decode</h3>
<p dir="auto">每个数据点跑 3 次（去除冷启动），取 median。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>Context (target)</td>
<td>Prompt tokens (actual)</td>
<td>Prefill t/s (median)</td>
<td>Prefill t/s (max / min)</td>
<td>Prefill ms/t (median)</td>
<td>Decode t/s (median)</td>
<td>Decode ms/t (median)</td>
</tr>
<tr>
<td>4 096</td>
<td>4 057</td>
<td>301.10</td>
<td>308.07 / 292.41</td>
<td>3.32</td>
<td>26.13</td>
<td>38.28</td>
</tr>
<tr>
<td>16 384</td>
<td>16 195</td>
<td>265.95</td>
<td>275.78 / 259.38</td>
<td>3.76</td>
<td>23.15</td>
<td>43.20</td>
</tr>
<tr>
<td>32 768</td>
<td>32 617</td>
<td>244.26</td>
<td>274.77 / 217.99</td>
<td>4.09</td>
<td>19.56</td>
<td>51.11</td>
</tr>
<tr>
<td>65 536</td>
<td>65 461</td>
<td>280.16</td>
<td>280.20 / 279.82</td>
<td>3.57</td>
<td>15.24</td>
<td>65.60</td>
</tr>
</tbody>
</table>
<blockquote></blockquote>
<blockquote>
<p dir="auto">一个值得注意的事实：Prefill 完全主导长 prompt 的总延迟。即便 64K 下 Decode 慢到 15.2 t/s，单条请求的 64 token 生成只要 4.1 秒；但 Prefill 那 234 秒是真等的。<br />
如果你的工作流是「长文档一次性灌入 + 短追问」，那你应该把眼睛盯在 Prefill 速度上；如果你做的是「多轮对话、每轮都要新生成 200+ token」，那么 Decode 速度才是体验瓶颈。<br />
<img src="https://upload.lcz.me/uploads/64b0fcbd-8b07-4e41-825b-749489e57328.png" alt="bench_chart_speed.png" class=" img-fluid img-markdown" /></p>
</blockquote>
<h3></h3>
<h2>3. 关键参数</h2>
<h3>① 不要写 <code>-ngl 99</code> 也不要写 <code>--split-mode layer --tensor-split 1,3</code></h3>
<p dir="auto">我最初是强制 <code>-ngl 99</code>，直接 cudaMalloc failed out of memory。原因很直白：</p>
<ul>
<li>模型 97 GB，两张卡总显存 32 GB，根本不可能全 offload。</li>
<li>强制 -ngl 99 让 <code>common_fit_params</code> 跳过自动适配，结果某些 expert 层被推到 GPU 0（3070，8 GB）上，单 expert 47 GB 装不下，cudaMalloc 失败。</li>
<li>手动 <code>--tensor-split 1,3</code> 也不行，因为 expert 层本身太大，不能被拆分。<br />
正确做法：不传 <code>-ngl</code>，让 llama.cpp 自动 fit 能上 GPU 的层，剩下的走 CPU + RAM。本地实测是 3070 占 6.5 GB、3090 占 23 GB、CPU 部分约 53 GB 落到系统内存。</li>
</ul>
<h4>② 双卡 + 不对称显存：要打开 <code>--no-mmap</code></h4>
<p dir="auto">默认 mmap 会让 CPU 部分按需从外置硬盘页入。我们的模型在外置 <code>/media/johnnyz/PROG_980/</code> 上，mmap + 频繁换页会让速度大幅波动。加 <code>--no-mmap</code>（已 deprecated，新写法 <code>--load-mode none</code>）一次性预读到 RAM，Prefill 速度更稳定。</p>
<h4>③ 32K+ 必须把 KV cache 降到 q4_0</h4>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td>Context</td>
<td>KV 精度</td>
<td>KV 占用</td>
<td>可行性</td>
</tr>
<tr>
<td>4 K</td>
<td>q8_0</td>
<td>~0.2 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 完全无压力</td>
</tr>
<tr>
<td>16 K</td>
<td>q8_0</td>
<td>~0.8 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> OK</td>
</tr>
<tr>
<td>32 K</td>
<td>q8_0</td>
<td>~1.6 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a0.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--warning" style="height:23px;width:auto;vertical-align:middle" title="⚠" alt="⚠" />️ 3090 23 GB 还能装下，但多轮后碎片占用会顶到 OOM</td>
</tr>
<tr>
<td>32 K / 64 K</td>
<td>q4_0</td>
<td>~0.8 GB / ~1.6 GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 跑稳</td>
</tr>
</tbody>
</table>
<h4></h4>
<h2>4. 主题深入</h2>
<h3>4.1 为什么 Decode 比 Prefill 掉得慢？</h3>
<p dir="auto">按理说 Decode 阶段每生成一个 token 都要过整个模型，应该比 Prefill 对 ctx 大小更敏感才对。但实测：</p>
<ul>
<li>Prefill：4K → 64K 掉 7%（如果剔除 32K 热降频的噪声）</li>
<li>Decode：4K → 64K 掉 42%<br />
Decode 才是真的对 ctx 敏感。Decode ms/t 从 38 涨到 66（+73%），符合 KV cache scan 成本线性增长的预期。</li>
</ul>
<blockquote>
<p dir="auto">这台机器 Decode 慢的真正原因是 MoE 路由的 expert 集中在 GPU 上、但仍需要从 CPU 内存抓其它专家——Flash-Next 是 Q3.8 大改版，专家路由在长 ctx 下触发更频繁，CPU<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2194.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--left_right_arrow" style="height:23px;width:auto;vertical-align:middle" title="↔" alt="↔" />GPU 数据搬运更多。</p>
</blockquote>
<h3>4.2 64K 反而比 32K Prefill 快的现象分析</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th></th>
<th></th>
<th></th>
<th></th>
</tr>
</thead>
<tbody>
<tr>
<td></td>
<td>32K run 1</td>
<td>32K run 3</td>
<td>64K run 1</td>
<td>64K run 3</td>
</tr>
<tr>
<td>GPU temp (估计)</td>
<td>73°C</td>
<td>90°C</td>
<td>70°C</td>
<td>85°C</td>
</tr>
<tr>
<td>Prefill t/s</td>
<td>274.77</td>
<td>217.99</td>
<td>280.20</td>
<td>280.16</td>
</tr>
</tbody>
</table>
<p dir="auto">表面看是 64K 比 32K 快。真相：</p>
<ul>
<li>64K 那 3 次 prefills 跑得比较快（每次 ~3.9 分钟），中间 GPU 没空冷</li>
<li>32K 那 3 次拖了更久（每次 ~2.2 分钟预填 + 短生成 + 等待间隔），GPU 进入 thermal steady state</li>
<li>32K 测量的 noise floor 包含了 thermal throttle</li>
</ul>
<h3>4.3 跨 PCIe 通信开销（推测）</h3>
<p dir="auto">两张 RTX 3070/3090 之间是 PCIe 4.0 x16，跨卡带宽 ~25 GB/s（实际单工 16-20 GB/s）。MoE expert layer 在 3090（装得下大头）+ 3070（小头）之间切换时，每次专家切换都要搬运 hidden state（2560 dim × FP16 = 5 KB），总量随 layer 数线性增长。</p>
<h2>5. 还没测的东西</h2>
<p dir="auto">这篇主要是 4K / 16K / 32K / 64K 四档 Prefill + Decode 的单实例单请求测试。还没认真做：</p>
<ul>
<li>--parallel 2/4 多并发压力测试（32GB 总显存不够同时两份全 ctx 跑）</li>
<li>128K / 262K（原生上下文）下的 Prefill 速度——按 issue #27871 描述，262K 在某些驱动上会 cudaMalloc invalid argument；本机也想验证</li>
<li>多轮对话"//////" 退化复现（issue #27797）—— 设 <code>LLAMA_ATTN_ROT_DISABLE=1</code> 是否有效</li>
<li>不同量化（Q4_K_M / Q5_K_M / Q6_K / Q8_0）的速度与质量取舍</li>
<li>dflash draft MTP（需要单独下载 ~5 GB 模型）</li>
<li>Hermes CLI / MCP 接入测试</li>
<li>GPU 温度严格控制下的 32K vs 64K Prefill 对比<br />
所以这篇更适合当成一份 3950X + RTX 3070/3090 双卡 + Qwen3.8-Flash-Next 的实机配置记录，不是完整 benchmark。当初要买卡的时候，电脑里本来就有3070了，当时的目标卡是4080 32G， 只要9000多块（跟现在的3090一个价钱！），但是想了想24+8 也是32G，于是只买了3090，之前一直跑27B小模型， 只用得到单卡，但是这次是我在本地跑过最大的模型了，勉勉强强能跑下来已经不错，也证明了当初我预测后面会用到24+8的想法，如果只是3090单卡，真的是跑不起来了。</li>
</ul>
<p dir="auto">最后的最后， 用 Flash-Next 生成了一个八卦图网站，请老特 <a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 品鉴。<br />
<img src="https://upload.lcz.me/uploads/0082e190-3427-4f09-a455-b059e584ead5.jpg" alt="flash_full_compressed.jpg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/1397</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 22:53:25 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1397.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 29 Aug 2026 05:43:24 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 没苦硬吃！！3090带着小弟跑Qwen3.8-Flash-Next IQ4双卡实测 on Mon, 07 Sep 2026 07:01:50 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/david-chen" aria-label="Profile: David-Chen">@<bdi>David-Chen</bdi></a> 我让AI帮忙配置的， 忘了看参数了， 不过你可以看我文章 3.关键参数 ， 那里面的注意就行了， 其他都是默认。</p>
]]></description><link>https://lcz.me/post/16367</link><guid isPermaLink="true">https://lcz.me/post/16367</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Mon, 07 Sep 2026 07:01:50 GMT</pubDate></item><item><title><![CDATA[Reply to 没苦硬吃！！3090带着小弟跑Qwen3.8-Flash-Next IQ4双卡实测 on Mon, 07 Sep 2026 03:52:49 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a> 可以分享你的啟動參數嗎？我想自己借你的啟動參數，用自己的設備實做一次...謝謝</p>
]]></description><link>https://lcz.me/post/16338</link><guid isPermaLink="true">https://lcz.me/post/16338</guid><dc:creator><![CDATA[David Chen]]></dc:creator><pubDate>Mon, 07 Sep 2026 03:52:49 GMT</pubDate></item><item><title><![CDATA[Reply to 没苦硬吃！！3090带着小弟跑Qwen3.8-Flash-Next IQ4双卡实测 on Sat, 05 Sep 2026 08:45:30 GMT]]></title><description><![CDATA[<p dir="auto">换3080是对的。3070这个小弟属实有拖后腿的意思了。</p>
]]></description><link>https://lcz.me/post/15992</link><guid isPermaLink="true">https://lcz.me/post/15992</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Sat, 05 Sep 2026 08:45:30 GMT</pubDate></item><item><title><![CDATA[Reply to 没苦硬吃！！3090带着小弟跑Qwen3.8-Flash-Next IQ4双卡实测 on Sat, 05 Sep 2026 08:35:05 GMT]]></title><description><![CDATA[<p dir="auto">Qwen3.5 122B IQ4_XS (65GB)</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>场景</th>
<th>r</th>
<th>comp</th>
<th>TTFT (s)</th>
<th>total (s)</th>
<th>decode t/s</th>
<th>tok/chunk</th>
</tr>
</thead>
<tbody>
<tr>
<td>code</td>
<td>1</td>
<td>512</td>
<td>2.035</td>
<td>18.15</td>
<td>31.7</td>
<td>1.00</td>
</tr>
<tr>
<td>code</td>
<td>2</td>
<td>512</td>
<td>0.338</td>
<td>15.67</td>
<td>33.3</td>
<td>1.00</td>
</tr>
<tr>
<td>en_tech</td>
<td>1</td>
<td>512</td>
<td>1.788</td>
<td>17.68</td>
<td>32.2</td>
<td>1.00</td>
</tr>
<tr>
<td>en_tech</td>
<td>2</td>
<td>512</td>
<td>0.335</td>
<td>15.76</td>
<td>33.1</td>
<td>1.00</td>
</tr>
<tr>
<td>cn_chat</td>
<td>1</td>
<td>512</td>
<td>1.697</td>
<td>17.06</td>
<td>33.3</td>
<td>1.00</td>
</tr>
<tr>
<td>cn_chat</td>
<td>2</td>
<td>512</td>
<td>0.334</td>
<td>15.34</td>
<td>34.0</td>
<td>1.00</td>
</tr>
<tr>
<td>cn_essay</td>
<td>1</td>
<td>460</td>
<td>0.478</td>
<td>14.57</td>
<td>32.6</td>
<td>1.01</td>
</tr>
<tr>
<td>cn_essay</td>
<td>2</td>
<td>460</td>
<td>0.339</td>
<td>13.91</td>
<td>33.8</td>
<td>1.00</td>
</tr>
</tbody>
</table>
<p dir="auto">GPU 占用：3090 = 22.7 GB, 3080 = 18.6 GB（41.3 GB 共）— 63% 模型放 GPU</p>
]]></description><link>https://lcz.me/post/15989</link><guid isPermaLink="true">https://lcz.me/post/15989</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sat, 05 Sep 2026 08:35:05 GMT</pubDate></item><item><title><![CDATA[Reply to 没苦硬吃！！3090带着小弟跑Qwen3.8-Flash-Next IQ4双卡实测 on Sat, 05 Sep 2026 08:32:54 GMT]]></title><description><![CDATA[<p dir="auto">這兩天把3070 8G 換成了 3080 20G， 果然有比較實質性的提升，結果如下：</p>
<p dir="auto">Qwen3.8 Flash Next 跑完！完整结果：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>场景</th>
<th>r</th>
<th>comp</th>
<th>TTFT (s)</th>
<th>total (s)</th>
<th>decode t/s</th>
<th>tok/chunk</th>
</tr>
</thead>
<tbody>
<tr>
<td>code</td>
<td>1</td>
<td>512</td>
<td>2.481</td>
<td>19.98</td>
<td>29.2</td>
<td>1.00</td>
</tr>
<tr>
<td>code</td>
<td>2</td>
<td>512</td>
<td>0.274</td>
<td>14.37</td>
<td>36.3</td>
<td>1.00</td>
</tr>
<tr>
<td>en_tech</td>
<td>1</td>
<td>512</td>
<td>1.994</td>
<td>18.72</td>
<td>30.6</td>
<td>1.00</td>
</tr>
<tr>
<td>en_tech</td>
<td>2</td>
<td>512</td>
<td>0.277</td>
<td>14.36</td>
<td>36.3</td>
<td>1.00</td>
</tr>
<tr>
<td>cn_chat</td>
<td>1</td>
<td>512</td>
<td>1.793</td>
<td>18.64</td>
<td>30.3</td>
<td>1.00</td>
</tr>
<tr>
<td>cn_chat</td>
<td>2</td>
<td>512</td>
<td>0.303</td>
<td>14.41</td>
<td>36.2</td>
<td>1.00</td>
</tr>
<tr>
<td>cn_essay</td>
<td>1</td>
<td>474</td>
<td>0.702</td>
<td>16.45</td>
<td>30.0</td>
<td>1.01</td>
</tr>
<tr>
<td>cn_essay</td>
<td>2</td>
<td>474</td>
<td>0.268</td>
<td>13.24</td>
<td>36.5</td>
<td>1.01</td>
</tr>
</tbody>
</table>
<p dir="auto">tok/chunk = 1.00：纯 autoregressive（未启用 DFlash2 spec-decode，因为你没传 --spec-type draft-dflash + DFlash2 draft model 路径）。</p>
]]></description><link>https://lcz.me/post/15988</link><guid isPermaLink="true">https://lcz.me/post/15988</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sat, 05 Sep 2026 08:32:54 GMT</pubDate></item><item><title><![CDATA[Reply to 没苦硬吃！！3090带着小弟跑Qwen3.8-Flash-Next IQ4双卡实测 on Sun, 30 Aug 2026 06:14:47 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 我觉得对个人来讲， 本地部署最大的意义不是隐私什么乱七八糟的， 个人能有多大隐私？ 而是本地可以部署去审查模型， 之前特地对比过审查和去审查的区别， 还是蛮大的。 比如前一阵有人帮论坛做了OWASP渗透测试，实操的话一般模型应该会拒绝，但是去审查的就可以做。这只是最最小的一个例子，其他方方面面的那可多了去了，没法网上说了。 本地能跑 180B的去审查模型，我很欣慰。</p>
]]></description><link>https://lcz.me/post/14901</link><guid isPermaLink="true">https://lcz.me/post/14901</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sun, 30 Aug 2026 06:14:47 GMT</pubDate></item><item><title><![CDATA[Reply to 没苦硬吃！！3090带着小弟跑Qwen3.8-Flash-Next IQ4双卡实测 on Sun, 30 Aug 2026 05:40:06 GMT]]></title><description><![CDATA[<p dir="auto">挺能折腾，顶一波。</p>
]]></description><link>https://lcz.me/post/14898</link><guid isPermaLink="true">https://lcz.me/post/14898</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Sun, 30 Aug 2026 05:40:06 GMT</pubDate></item><item><title><![CDATA[Reply to 没苦硬吃！！3090带着小弟跑Qwen3.8-Flash-Next IQ4双卡实测 on Sun, 30 Aug 2026 01:41:53 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/tony-wang" aria-label="Profile: Tony-Wang">@<bdi>Tony-Wang</bdi></a></p>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/tony-wang" aria-label="Profile: Tony-Wang">@<bdi>Tony-Wang</bdi></a> 我也是同样的感觉， 我生成八卦图的时候， 平均速度达到了 24t/s ， 真实可用了。 唯一慢的确实就是prefill， 基本第一次需要3分钟左右， 但是对话起来就快很多了。</p>
]]></description><link>https://lcz.me/post/14872</link><guid isPermaLink="true">https://lcz.me/post/14872</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Sun, 30 Aug 2026 01:41:53 GMT</pubDate></item><item><title><![CDATA[Reply to 没苦硬吃！！3090带着小弟跑Qwen3.8-Flash-Next IQ4双卡实测 on Sat, 29 Aug 2026 20:04:39 GMT]]></title><description><![CDATA[<p dir="auto">不错, 虽然prefill慢一点儿, decode是不错的. 看来可以试着部署一下. <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f44d.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--+1" style="height:23px;width:auto;vertical-align:middle" title=":+1:" alt="👍" /> <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f44d.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--+1" style="height:23px;width:auto;vertical-align:middle" title=":+1:" alt="👍" /></p>
]]></description><link>https://lcz.me/post/14854</link><guid isPermaLink="true">https://lcz.me/post/14854</guid><dc:creator><![CDATA[Tony Wang]]></dc:creator><pubDate>Sat, 29 Aug 2026 20:04:39 GMT</pubDate></item></channel></rss>