<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[雙 AMD Radeon AI PRO R9700跑Qwen3.8-Flash-Next Q3量化模型]]></title><description><![CDATA[<h1>雙 R9700 跑 Qwen3.8-Flash-Next Q3 實測成果</h1>
<p dir="auto">最近持續在 <strong>雙 AMD Radeon AI PRO R9700（2×32GB，共 64GB VRAM）+ 224GB DDR5 RAM</strong> 的工作站上測試 <code>Qwen3.8-Flash-Next</code>。</p>
<p dir="auto">本次測試核心在於：<strong>使用雙 R9700 的 64GB VRAM 運行總重約 83.4GB 的 Qwen3.8-Flash-Next</strong>。透過 <strong>PLE（Per-Layer Token Embedding）Offload</strong> 技術，成功達成 128K 完整 Context、48 層 MoE Experts 全留 GPU（Zero Spill），並取得 Decode 約 <strong>55.36 tok/s</strong> 的優異表現。</p>
<hr />
<h2>系統與模型規格</h2>
<h3>硬體配置</h3>
<ul>
<li><strong>GPU</strong>：AMD Radeon AI PRO R9700 32GB × 2</li>
<li><strong>總 VRAM</strong>：64GB</li>
<li><strong>System RAM</strong>：224GB DDR5</li>
<li><strong>架構</strong>：AMD RDNA4</li>
</ul>
<h3>模型與運行環境</h3>
<ul>
<li><strong>模型版本</strong>：<code>Qwen3.8-Flash-Next-Uncensored.i1-IQ3_M</code></li>
<li><strong>模型總權重</strong>：約 83.4 GB</li>
<li><strong>主力環境</strong>：Windows + Vulkan（llama.cpp / llama-server）</li>
</ul>
<hr />
<h2>記憶體與顯存分配架構</h2>
<p dir="auto">為了解決 83.4GB 模型大於 64GB 實體顯存的限制，採取策略性分流：將最具計算密集的 MoE Experts 鎖定於 VRAM，而將體積龐大但計算相對單純的 PLE 卸載至系統主記憶體。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:left">項目</th>
<th style="text-align:center">容量 / 配置</th>
<th style="text-align:left">說明</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:left"><strong>GPU 駐留模型權重</strong></td>
<td style="text-align:center">約 <strong>56.6 GB</strong></td>
<td style="text-align:left">48 層 MoE Experts 全部駐留 VRAM</td>
</tr>
<tr>
<td style="text-align:left"><strong>System RAM 卸載權重</strong></td>
<td style="text-align:center">約 <strong>26.8 GB</strong></td>
<td style="text-align:left">PLE Token Embedding 卸載至 Host RAM</td>
</tr>
<tr>
<td style="text-align:left"><strong>128K KV Cache</strong></td>
<td style="text-align:center">約 <strong>3.2 GB</strong></td>
<td style="text-align:left">使用 Q4_0 量化（<code>ctk q4_0</code> / <code>ctv q4_0</code>）</td>
</tr>
<tr>
<td style="text-align:left"><strong>GPU 1 (主卡) VRAM</strong></td>
<td style="text-align:center">約 <strong>30.8 GB</strong></td>
<td style="text-align:left">承擔系統與顯示負載，分配 48% 權重</td>
</tr>
<tr>
<td style="text-align:left"><strong>GPU 2 (副卡) VRAM</strong></td>
<td style="text-align:center">約 <strong>31.2 GB</strong></td>
<td style="text-align:left">純運算卡，分配 52% 權重</td>
</tr>
<tr>
<td style="text-align:left"><strong>雙卡總 VRAM 佔用</strong></td>
<td style="text-align:center">約 <strong>62.0 GB / 64 GB</strong></td>
<td style="text-align:left">留有安全餘裕</td>
</tr>
<tr>
<td style="text-align:left"><strong>Expert 溢出狀態</strong></td>
<td style="text-align:center"><strong>Zero Spill</strong></td>
<td style="text-align:left">測試期間未出現任何 Expert Spill</td>
</tr>
</tbody>
</table>
<hr />
<h2>實測效能表現</h2>
<ul>
<li><strong>Context 長度</strong>：131,072 tokens（128K）</li>
<li><strong>解碼速度（Decode）</strong>：<strong>55.36 tok/s</strong></li>
<li><strong>雙卡負載切分（Tensor Split）</strong>：<code>0.48 / 0.52</code></li>
<li><strong>MTP（Multi-Token Prediction）實測</strong>：
<ul>
<li>在 <strong>64K Context</strong> 環境下測試，Draft acceptance 率約達 <strong>56.4%</strong>。</li>
</ul>
</li>
</ul>
<hr />
<h2>關鍵配置策略</h2>
<ol>
<li><strong>強制 Experts 留駐 GPU</strong>：
<ul>
<li>使用 <code>-ncmoe 0</code>，禁止 MoE Experts 卸載至 CPU，確保 48 層 Experts 計算均享有 GPU 高頻寬。</li>
</ul>
</li>
<li><strong>PLE 卸載至系統記憶體</strong>：
<ul>
<li>使用 <code>-ot "per_layer_token_embd.weight=CPU"</code>，將約 26.8GB 的 PLE 權重放至 224GB Host RAM，完美釋放近 27GB 的 VRAM 空間給 Experts 與 KV Cache。</li>
</ul>
</li>
</ol>
<hr />
<h2>完整啟動腳本配置</h2>
<p dir="auto">PowerShell 啟動指令如下：</p>
<pre><code class="language-powershell">&amp; $LLAMA_SERVER -m $MODEL `
  --mmproj $MMPROJ `
  --device "Vulkan1,Vulkan2" `
  --split-mode layer `
  --tensor-split 0.48,0.52 `
  --fit off `
  -ngl 999 `
  -ncmoe 0 `
  -ot "per_layer_token_embd.weight=CPU" `
  --ctx-size 131072 `
  --parallel 1 `
  -fa on `
  -ctk q4_0 `
  -ctv q4_0 `
  -b 2048 `
  -ub 512 `
  --threads 4 `
  -lm mmap `
  --jinja `
  --host 127.0.0.1 `
  --port 8080
</code></pre>
<hr />
<h2>標籤</h2>
<p dir="auto"><code>#LocalLLM</code> <code>#R9700</code> <code>#Qwen</code> <code>#MoE</code> <code>#llamacpp</code> <code>#AMD</code> <code>#RDNA4</code></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/d9543d7a-23d0-4e36-86c9-a08d6a9ad221.jpg" alt="FB_IMG_1789308961311.jpg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/1683</link><generator>RSS for Node</generator><lastBuildDate>Fri, 25 Sep 2026 22:14:41 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1683.rss" rel="self" type="application/rss+xml"/><pubDate>Sun, 13 Sep 2026 14:19:02 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 雙 AMD Radeon AI PRO R9700跑Qwen3.8-Flash-Next Q3量化模型 on Sun, 13 Sep 2026 16:03:40 GMT]]></title><description><![CDATA[<p dir="auto">PLE 放 host、MoE experts 全留 64G 显存这个取舍是对的，128K 下 55 tok/s 很能打。</p>
<p dir="auto">一个还能再压的点：PLE offload 和 experts 都在吃 PCIe，可以对比「PLE 放 host」和「少量 -ncmoe 卸载 + experts 留显存」两条路线，看哪条 decode 更高——取决于层结构和 host 内存带宽，不一定 PLE 那条就赢。</p>
<p dir="auto">MTP acceptance 56% 在 Q3 下算正常偏上，想再抬可以调 draft 相关参数，并记录 acceptance length 分布，别只看均值。</p>
]]></description><link>https://lcz.me/post/17910</link><guid isPermaLink="true">https://lcz.me/post/17910</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sun, 13 Sep 2026 16:03:40 GMT</pubDate></item><item><title><![CDATA[Reply to 雙 AMD Radeon AI PRO R9700跑Qwen3.8-Flash-Next Q3量化模型 on Sun, 13 Sep 2026 14:24:40 GMT]]></title><description><![CDATA[<p dir="auto">我們論壇 雙卡流的真多 Dual-RX7900 XTX vs. Dual-AI Pro R9700 對決</p>
]]></description><link>https://lcz.me/post/17884</link><guid isPermaLink="true">https://lcz.me/post/17884</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Sun, 13 Sep 2026 14:24:40 GMT</pubDate></item></channel></rss>