<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP]]></title><description><![CDATA[<h2>一、软件栈与环境信息</h2>
<ul>
<li><strong>推理引擎：</strong> <code>exllamav3 1.5.1+cu128.torch2.9.0</code>（官方 wheel、Python 3.12 venv、免 JIT 编译）</li>
<li><strong>API 服务器：</strong> <code>TabbyAPI main</code>（commit：<code>7208273</code>）</li>
<li><strong>操作系统 / 内核：</strong> Linux Mint 22.3（Zena）/ Kernel <code>7.0.0-31-generic</code></li>
<li><strong>对话模板（Chat Template）：</strong> 自定义 <code>tabby_template.jinja</code>（<code>qwen3.8-froggeric-v22.3</code>，修复内置版硬例外）</li>
</ul>
<h2>二、硬件规格</h2>
<ul>
<li><strong>CPU：</strong> AMD Ryzen 5 5600X（6C/12T）</li>
<li><strong>主板：</strong> ASUS PRIME X570-PRO（SMBIOS 3.3.0）</li>
<li><strong>系统内存：</strong> 64 GB（4×16 GB）DDR4 3600，双通道</li>
<li><strong>显卡：</strong> 2 张 RTX 4070 Ti SUPER（Gen4 ×4）+ 2 张 RTX 5070 Ti（Gen4 ×8）</li>
<li>其中一张 RTX 4070 Ti SUPER 使用了 M.2 转接</li>
</ul>
<h2>三、模型与量化文件架构</h2>
<ul>
<li><strong>模型架构：</strong> Qwen3.8-Flash-Next</li>
<li><strong>量化格式：</strong> EXL3 3.05 bpw</li>
<li><strong>量化文件：</strong> <a href="https://huggingface.co/turboderp/Qwen3.8-Flash-Next-exl3/tree/3.05bpw_h5_ng5" rel="nofollow ugc">Qwen3.8-Flash-Next-exl3</a></li>
<li><strong>主模型权重本体：</strong> 52.3 GB，分散于 4 张 GPU 显存中</li>
<li><strong>PLE n-gram embedding：</strong> 32.6 GB，配置 <code>ngram_ram: true</code>，常驻于 64 GB 系统内存</li>
</ul>
<h2>四、生效配置文件与采样设置</h2>
<h3>1. <code>config.yml</code></h3>
<pre><code class="language-yaml">model:
  model_name: Qwen3.8-Flash-Next-exl3
  max_seq_len: 131072
  cache_size: 131072          # 130K 上下文池
  cache_mode: Q8              # 必须使用 Q8；FP16 会导致 VRAM 溢出
  cpu_moe_split_experts: 0    # 专家全上卡，严禁 offload 至 CPU
  ngram_ram: true             # 32.6 GB n-gram 走系统 RAM
  gpu_split_auto: true
  tensor_parallel: false
  autosplit_reserve: [512, 512, 768, 512]   # 非对称分配：主屏幕卡（GPU 2）保留 768 MB
  chunk_size: 1024            # 设置为 2048 会爆 VRAM
  reasoning: true
  tool_format: qwen3_coder    # 未设置此项，Server 不会解析工具调用
  template_vars_default: {reasoning_effort: medium}
  reasoning_budget_tokens: 2048

draft_model:                  # 必须为顶层区块，不可缩进至 model 内部
  draft_mode: mtp              # 直接调用主模型目录内置的 MTP 组件
  draft_num_tokens: 2         # 设置为 2，达到显存与加速平衡；设置为 4 会 OOM
  draft_cache_mode: Q8        # 必须使用 Q8；默认 FP16 会超出 VRAM

sampling:
  override_preset: qwen_next_flash   # 防止长思考崩坏
</code></pre>
<h3>2. 采样覆写：<code>sampler_overrides/qwen_next_flash.yml</code></h3>
<pre><code class="language-yaml"># 针对低 bit（3.05 bpw）量化产生的噪声 logit 进行尾部剪枝，避免文字崩坏
temperature: 1.0
top_p: 0.95
top_k: 20
min_p: 0.0
</code></pre>
<h2>五、实测推理性能数据</h2>
<p dir="auto">以下数据由 HERMES 执行实际任务时，从 <code>tabby.log</code> 中提取。</p>
<ul>
<li><strong>冷 Prefill 稳态：</strong> 约 1,900–2,030 T/s</li>
<li><strong>解码生成速度：</strong> 约 106–132 T/s</li>
<li>即使上下文长度增加至 113K，解码速度依然没有明显衰减</li>
</ul>
<h3>1. 冷请求：全量 Prefill / 无缓存</h3>
<p dir="auto">按总长度升序排列。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:right">总长度（Tokens）</th>
<th style="text-align:center">缓存命中</th>
<th style="text-align:right">Prefill 速度</th>
<th style="text-align:right">首字延迟（TTFT）</th>
<th style="text-align:right">输出长度</th>
<th style="text-align:right">Decode 速度</th>
<th style="text-align:center">MTP 接受率</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:right">18,003*</td>
<td style="text-align:center">0%（冷）</td>
<td style="text-align:right">859 T/s</td>
<td style="text-align:right">21.00 s</td>
<td style="text-align:right">153 tok</td>
<td style="text-align:right">128.1 T/s</td>
<td style="text-align:center">89%（98/110）</td>
</tr>
<tr>
<td style="text-align:right">18,256</td>
<td style="text-align:center">0%（冷）</td>
<td style="text-align:right">1,920 T/s</td>
<td style="text-align:right">9.55 s</td>
<td style="text-align:right">188 tok</td>
<td style="text-align:right">126.2 T/s</td>
<td style="text-align:center">88%（120/136）</td>
</tr>
<tr>
<td style="text-align:right">18,256</td>
<td style="text-align:center">0%（冷）</td>
<td style="text-align:right">1,926 T/s</td>
<td style="text-align:right">9.52 s</td>
<td style="text-align:right">247 tok</td>
<td style="text-align:right">120.6 T/s</td>
<td style="text-align:center">80%（152/190）</td>
</tr>
<tr>
<td style="text-align:right">35,355</td>
<td style="text-align:center">0%（冷）</td>
<td style="text-align:right">1,926 T/s</td>
<td style="text-align:right">18.40 s</td>
<td style="text-align:right">2,970 tok</td>
<td style="text-align:right">121.5 T/s</td>
<td style="text-align:center">82%（1,847/2,246）</td>
</tr>
<tr>
<td style="text-align:right">36,786</td>
<td style="text-align:center">0%（冷）</td>
<td style="text-align:right">1,900 T/s</td>
<td style="text-align:right">19.40 s</td>
<td style="text-align:right">2,599 tok</td>
<td style="text-align:right">120.7 T/s</td>
<td style="text-align:center">82%（1,612/1,974）</td>
</tr>
<tr>
<td style="text-align:right">37,974</td>
<td style="text-align:center">0%（冷）</td>
<td style="text-align:right">2,030 T/s</td>
<td style="text-align:right">18.70 s</td>
<td style="text-align:right">2,519 tok</td>
<td style="text-align:right">111.1 T/s</td>
<td style="text-align:center">71%（1,476/2,086）</td>
</tr>
</tbody>
</table>
<h3>2. 热请求：缓存命中 / 多轮对话</h3>
<p dir="auto">按总上下文长度升序排列。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:right">总上下文长度</th>
<th style="text-align:center">缓存命中率</th>
<th style="text-align:right">新输入（tok）</th>
<th style="text-align:right">Prefill 速度</th>
<th style="text-align:right">首字延迟</th>
<th style="text-align:right">输出长度</th>
<th style="text-align:right">Decode 速度</th>
<th style="text-align:center">MTP 接受率</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:right">18,733</td>
<td style="text-align:center">98%</td>
<td style="text-align:right">301</td>
<td style="text-align:right">734 T/s</td>
<td style="text-align:right">0.43 s</td>
<td style="text-align:right">185 tok</td>
<td style="text-align:right">120.7 T/s</td>
<td style="text-align:center">80%（114/142）</td>
</tr>
<tr>
<td style="text-align:right">23,174</td>
<td style="text-align:center">77%</td>
<td style="text-align:right">5,254</td>
<td style="text-align:right">1,876 T/s</td>
<td style="text-align:right">2.82 s</td>
<td style="text-align:right">707 tok</td>
<td style="text-align:right">121.4 T/s</td>
<td style="text-align:center">81%（437/540）</td>
</tr>
<tr>
<td style="text-align:right">27,948</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">300</td>
<td style="text-align:right">769 T/s</td>
<td style="text-align:right">0.41 s</td>
<td style="text-align:right">116 tok</td>
<td style="text-align:right">116.8 T/s</td>
<td style="text-align:center">76%（70/92）</td>
</tr>
<tr>
<td style="text-align:right">31,508</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">276</td>
<td style="text-align:right">767 T/s</td>
<td style="text-align:right">0.38 s</td>
<td style="text-align:right">298 tok</td>
<td style="text-align:right">101.2 T/s</td>
<td style="text-align:center">60%（162/272）</td>
</tr>
<tr>
<td style="text-align:right">35,377</td>
<td style="text-align:center">98%</td>
<td style="text-align:right">817</td>
<td style="text-align:right">1,362 T/s</td>
<td style="text-align:right">0.62 s</td>
<td style="text-align:right">443 tok</td>
<td style="text-align:right">106.7 T/s</td>
<td style="text-align:center">65%（251/384）</td>
</tr>
<tr>
<td style="text-align:right">39,794</td>
<td style="text-align:center">98%</td>
<td style="text-align:right">626</td>
<td style="text-align:right">1,118 T/s</td>
<td style="text-align:right">0.58 s</td>
<td style="text-align:right">212 tok</td>
<td style="text-align:right">121.5 T/s</td>
<td style="text-align:center">81%（131/162）</td>
</tr>
<tr>
<td style="text-align:right">43,567</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">559</td>
<td style="text-align:right">1,118 T/s</td>
<td style="text-align:right">0.52 s</td>
<td style="text-align:right">1,103 tok</td>
<td style="text-align:right">93.5 T/s</td>
<td style="text-align:center">51%（556/1,094）</td>
</tr>
<tr>
<td style="text-align:right">47,586</td>
<td style="text-align:center">97%</td>
<td style="text-align:right">1,506</td>
<td style="text-align:right">891 T/s</td>
<td style="text-align:right">1.73 s</td>
<td style="text-align:right">2,454 tok</td>
<td style="text-align:right">106.8 T/s</td>
<td style="text-align:center">66%（1,396/2,116）</td>
</tr>
<tr>
<td style="text-align:right">51,843</td>
<td style="text-align:center">87%</td>
<td style="text-align:right">6,787</td>
<td style="text-align:right">1,854 T/s</td>
<td style="text-align:right">3.68 s</td>
<td style="text-align:right">574 tok</td>
<td style="text-align:right">107.9 T/s</td>
<td style="text-align:center">66%（327/494）</td>
</tr>
<tr>
<td style="text-align:right">55,748</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">452</td>
<td style="text-align:right">962 T/s</td>
<td style="text-align:right">0.49 s</td>
<td style="text-align:right">990 tok</td>
<td style="text-align:right">106.6 T/s</td>
<td style="text-align:center">65%（561/858）</td>
</tr>
<tr>
<td style="text-align:right">59,840</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">448</td>
<td style="text-align:right">282 T/s</td>
<td style="text-align:right">1.63 s</td>
<td style="text-align:right">2,264 tok</td>
<td style="text-align:right">98.9 T/s</td>
<td style="text-align:center">57%（1,209/2,110）</td>
</tr>
<tr>
<td style="text-align:right">62,535</td>
<td style="text-align:center">95%</td>
<td style="text-align:right">2,887</td>
<td style="text-align:right">1,688 T/s</td>
<td style="text-align:right">1.73 s</td>
<td style="text-align:right">2,428 tok</td>
<td style="text-align:right">110.1 T/s</td>
<td style="text-align:center">70%（1,417/2,022）</td>
</tr>
<tr>
<td style="text-align:right">67,834</td>
<td style="text-align:center">98%</td>
<td style="text-align:right">1,274</td>
<td style="text-align:right">1,554 T/s</td>
<td style="text-align:right">0.84 s</td>
<td style="text-align:right">344 tok</td>
<td style="text-align:right">103.8 T/s</td>
<td style="text-align:center">62%（190/308）</td>
</tr>
<tr>
<td style="text-align:right">71,659</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">747</td>
<td style="text-align:right">622 T/s</td>
<td style="text-align:right">1.24 s</td>
<td style="text-align:right">2,152 tok</td>
<td style="text-align:right">106.5 T/s</td>
<td style="text-align:center">66%（1,224/1,856）</td>
</tr>
<tr>
<td style="text-align:right">75,806</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">1,054</td>
<td style="text-align:right">1,573 T/s</td>
<td style="text-align:right">0.69 s</td>
<td style="text-align:right">1,644 tok</td>
<td style="text-align:right">99.9 T/s</td>
<td style="text-align:center">59%（887/1,514）</td>
</tr>
<tr>
<td style="text-align:right">79,545</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">953</td>
<td style="text-align:right">1,381 T/s</td>
<td style="text-align:right">0.75 s</td>
<td style="text-align:right">731 tok</td>
<td style="text-align:right">112.9 T/s</td>
<td style="text-align:center">73%（434/594）</td>
</tr>
<tr>
<td style="text-align:right">83,850</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">1,162</td>
<td style="text-align:right">759 T/s</td>
<td style="text-align:right">1.57 s</td>
<td style="text-align:right">2,239 tok</td>
<td style="text-align:right">102.2 T/s</td>
<td style="text-align:center">61%（1,232/2,014）</td>
</tr>
<tr>
<td style="text-align:right">87,415</td>
<td style="text-align:center">98%</td>
<td style="text-align:right">1,655</td>
<td style="text-align:right">1,547 T/s</td>
<td style="text-align:right">1.09 s</td>
<td style="text-align:right">2,297 tok</td>
<td style="text-align:right">108.0 T/s</td>
<td style="text-align:center">68%（1,322/1,950）</td>
</tr>
<tr>
<td style="text-align:right">89,078</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">1,014</td>
<td style="text-align:right">685 T/s</td>
<td style="text-align:right">1.52 s</td>
<td style="text-align:right">2,242 tok</td>
<td style="text-align:right">102.2 T/s</td>
<td style="text-align:center">61%（1,233/2,018）</td>
</tr>
<tr>
<td style="text-align:right">94,938</td>
<td style="text-align:center">74%</td>
<td style="text-align:right">25,050</td>
<td style="text-align:right">1,802 T/s</td>
<td style="text-align:right">13.90 s</td>
<td style="text-align:right">2,982 tok</td>
<td style="text-align:right">109.3 T/s</td>
<td style="text-align:center">70%（1,738/2,488）</td>
</tr>
<tr>
<td style="text-align:right">99,334</td>
<td style="text-align:center">98%</td>
<td style="text-align:right">2,310</td>
<td style="text-align:right">1,604 T/s</td>
<td style="text-align:right">1.46 s</td>
<td style="text-align:right">646 tok</td>
<td style="text-align:right">107.8 T/s</td>
<td style="text-align:center">68%（372/548）</td>
</tr>
<tr>
<td style="text-align:right">111,691</td>
<td style="text-align:center">99%</td>
<td style="text-align:right">843</td>
<td style="text-align:right">1,297 T/s</td>
<td style="text-align:right">0.67 s</td>
<td style="text-align:right">1,770 tok</td>
<td style="text-align:right">112.6 T/s</td>
<td style="text-align:center">74%（1,056/1,428）</td>
</tr>
<tr>
<td style="text-align:right">113,355</td>
<td style="text-align:center">100%</td>
<td style="text-align:right">459</td>
<td style="text-align:right">883 T/s</td>
<td style="text-align:right">0.54 s</td>
<td style="text-align:right">676 tok</td>
<td style="text-align:right">112.5 T/s</td>
<td style="text-align:center">73%（402/548）</td>
</tr>
</tbody>
</table>
<h2>六、个人使用心得</h2>
<p dir="auto">在 3.05 bpw 的量化之下，我还是觉得 Qwen3.8-Flash-Next 比 Qwen3.8 27B FP8 量化更聪明。但在较为单纯的任务中，Qwen3.8 27B FP8 会更加精准，犯错也更少。</p>
<p dir="auto">不过，Qwen3.8-Flash-Next 的回应方式让我感觉更像人。即使犯错，它也能够自己修正过来。在这样的使用速度下，我愿意让它多迭代几次，以提高最终任务质量。</p>
<p dir="auto">希望各位也多多讨论使用心得。如果有需要，我可以再找几个范例任务来展示。</p>
]]></description><link>https://lcz.me/topic/1891</link><generator>RSS for Node</generator><lastBuildDate>Fri, 25 Sep 2026 21:27:17 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1891.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 22 Sep 2026 11:06:07 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Wed, 23 Sep 2026 01:26:24 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/david-chen" aria-label="Profile: David-Chen">@<bdi>David-Chen</bdi></a></p>
<p dir="auto">肯定會試驗的 當初買同型號4卡就是要整在一起<br />
先等二號機可以跑了 就把GPU一起上線看看效果 看我當初的採購決策是不是錯誤 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f633.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--flushed" style="height:23px;width:auto;vertical-align:middle" title=":flushed:" alt="😳" /></p>
<p dir="auto">對了我發現 <a href="http://vast.ai" rel="nofollow ugc">vast.ai</a> 上有很多四卡機, 5090 居多 你可以先試試</p>
]]></description><link>https://lcz.me/post/20157</link><guid isPermaLink="true">https://lcz.me/post/20157</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Wed, 23 Sep 2026 01:26:24 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 19:28:35 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/kos-or" aria-label="Profile: kos-or">@<bdi>kos-or</bdi></a> 其實AI吹牛B也不是一天兩天的事了</p>
<p dir="auto">我當初要弄這功能AI也是評估效果不好</p>
<p dir="auto">但我堅持之下，直接打臉AI判斷</p>
<p dir="auto">看看你要不要試試四張並行....因為我沒有四張....不然我早就跳下去做了 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f604.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--smile" style="height:23px;width:auto;vertical-align:middle" title=":smile:" alt="😄" /></p>
]]></description><link>https://lcz.me/post/20129</link><guid isPermaLink="true">https://lcz.me/post/20129</guid><dc:creator><![CDATA[David Chen]]></dc:creator><pubDate>Tue, 22 Sep 2026 19:28:35 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 16:48:04 GMT]]></title><description><![CDATA[<p dir="auto">试了一下， 在3090上面速度提升了 30%， 不错不错</p>
]]></description><link>https://lcz.me/post/20120</link><guid isPermaLink="true">https://lcz.me/post/20120</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Tue, 22 Sep 2026 16:48:04 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 16:35:16 GMT]]></title><description><![CDATA[<p dir="auto">4 GPU Tensor Parallelism 根據和AI討論結果, 需要大量的All Reduce....卡和卡之間的通訊量會非常大, 但實際上有多大我也不知道, 如果使用 4 x PCIe 5.0 x 16 (64GB/s) 板子不便宜</p>
]]></description><link>https://lcz.me/post/20119</link><guid isPermaLink="true">https://lcz.me/post/20119</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Tue, 22 Sep 2026 16:35:16 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Wed, 23 Sep 2026 01:26:53 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/david-chen" aria-label="Profile: David-Chen">@<bdi>David-Chen</bdi></a> <a href="/post/20109">said</a>:</p>
<p dir="auto">去apply 我那個 P2P(直連) patch</p>
</blockquote>
<p dir="auto">你是說這一篇嗎？開源社群釋出非官方破解版驅動，實現 RTX 5090 P2P 共享記憶體共享(類似nvlnk方法) 我目前只上了兩張卡 另外兩張躺在書櫃, 還在測試RX7900XTX和整第二台機器</p>
<p dir="auto">對了 這裡有一篇論文可以讓ChatGPT 整理一下, 關於單卡和多卡 Blackwell 消費級顯卡的成本效益表現<br />
"Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs" (arXiv:2601.09527):<br />
Direct PDF Download: <a href="https://arxiv.org/pdf/2601.09527" rel="nofollow ugc">https://arxiv.org/pdf/2601.09527</a></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/f57c1fe6-e350-408a-ae62-82505abf10e7.jpeg" alt="2d4be0b6-af8a-41e9-a779-909dce6d25a2-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/20118</link><guid isPermaLink="true">https://lcz.me/post/20118</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Wed, 23 Sep 2026 01:26:53 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 15:49:35 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/kos-or" aria-label="Profile: kos-or">@<bdi>kos-or</bdi></a> 你四個N卡要不要去apply 我那個 P2P(直連) patch?</p>
<p dir="auto">效果好的話，我想自己也來弄個四張一起跑</p>
]]></description><link>https://lcz.me/post/20109</link><guid isPermaLink="true">https://lcz.me/post/20109</guid><dc:creator><![CDATA[David Chen]]></dc:creator><pubDate>Tue, 22 Sep 2026 15:49:35 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 15:47:52 GMT]]></title><description><![CDATA[<p dir="auto">decode &gt; 100<br />
prefill &gt; 2000<br />
這已經是可用狀態了.....晚點偷抄你的作業 ^_^</p>
]]></description><link>https://lcz.me/post/20108</link><guid isPermaLink="true">https://lcz.me/post/20108</guid><dc:creator><![CDATA[David Chen]]></dc:creator><pubDate>Tue, 22 Sep 2026 15:47:52 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 15:38:48 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto">即使上下文长度增加至 113K，解码速度依然没有明显衰减</p>
</blockquote>
<p dir="auto">謝謝分享, 否則我都懷疑 我買NVIDIA 4卡16GB是不是一種錯誤的決定</p>
]]></description><link>https://lcz.me/post/20107</link><guid isPermaLink="true">https://lcz.me/post/20107</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Tue, 22 Sep 2026 15:38:48 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 13:11:06 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/allen-tsai" aria-label="Profile: Allen-Tsai">@<bdi>Allen-Tsai</bdi></a> 以后大段帖子让AI整理成markdown格式，下不为例。</p>
]]></description><link>https://lcz.me/post/20079</link><guid isPermaLink="true">https://lcz.me/post/20079</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Tue, 22 Sep 2026 13:11:06 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 13:02:56 GMT]]></title><description><![CDATA[<p dir="auto">异构四卡这套，TP 的瓶颈不在总算力，在<strong>最慢那条链路</strong>：两张 4070Ti Super 走 Gen4 ×4、两张 5070Ti 走 ×8，exllamav3 做 TP 时每层都要跨卡同步，会被 ×4 的卡拖住；并发越高越明显。</p>
<p dir="auto">更划算的分工：</p>
<ul>
<li><strong>按架构配对</strong>：2×5070Ti 一组 TP=2、2×4070Ti Super 一组 TP=2，跑两个独立实例。同架构没有跨代内核回退问题，链路也各自独立，单请求 decode 反而更快。</li>
<li><strong>只有模型大到单对卡放不下</strong>时，才四卡同一模型；这时优先「层切」而不是纯 TP，减少每 token 的跨卡同步次数。</li>
<li>MTP / 投机：draft 头和 target 要放在能快速互访的卡上；异构混合 PCIe 下，投机多出来的通信可能把收益吃掉，建议开/关各跑一组 pp/tg 对比。</li>
<li>130k 上下文 + 4×16G：权重之外 KV 余量不大，先把 KV 量化开起来；同时确认 Ada（4070TiS）和 Blackwell（5070Ti）混跑没有按最低架构回退内核。</li>
</ul>
<p dir="auto">排版小事用 Markdown 表格 <code>|</code> 就行，编辑框旁边有预览，先写纯文本再贴也不会乱。</p>
]]></description><link>https://lcz.me/post/20076</link><guid isPermaLink="true">https://lcz.me/post/20076</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Tue, 22 Sep 2026 13:02:56 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 12:26:06 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a> 感謝幫忙，我發文時找不到表格排版的按鈕</p>
]]></description><link>https://lcz.me/post/20070</link><guid isPermaLink="true">https://lcz.me/post/20070</guid><dc:creator><![CDATA[Allen Tsai]]></dc:creator><pubDate>Tue, 22 Sep 2026 12:26:06 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 12:04:20 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E9%8D%BE%E5%AD%90%E6%8F%9A" aria-label="Profile: 鍾子揚">@<bdi>鍾子揚</bdi></a> 这个exllamav3引擎是 nvidia专用的。</p>
]]></description><link>https://lcz.me/post/20068</link><guid isPermaLink="true">https://lcz.me/post/20068</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Tue, 22 Sep 2026 12:04:20 GMT</pubDate></item><item><title><![CDATA[Reply to NVIDIA 4卡異構 挑戰 Exllamav3 + Qwen3.8-Flash-Next 130k 上下文+MTP on Tue, 22 Sep 2026 12:03:40 GMT]]></title><description><![CDATA[<p dir="auto">速度好快！！我兩張r9700只能調整到60多token/s，128k時只有50出頭</p>
]]></description><link>https://lcz.me/post/20067</link><guid isPermaLink="true">https://lcz.me/post/20067</guid><dc:creator><![CDATA[鍾子揚]]></dc:creator><pubDate>Tue, 22 Sep 2026 12:03:40 GMT</pubDate></item></channel></rss>