<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[Qwen3.8-27B 量化全格式橫評：從 IQ2_XXS 到 Q6_K，14 種格式誰才是甜點？]]></title><description><![CDATA[<p dir="auto">近一週論壇上 Qwen3.8-27B 的帖密度很高，但大多聚焦在特定一張卡跑一兩種量化。量化格式選錯，輕則掉智商，重則 OOM 直接跑不起來。這篇把 llama.cpp 目前支援的 14 種格式從 2-bit 到 6-bit 全攤開比，附上文件大小、最小 VRAM、質量評級、適用場景，你找到自己的顯存對應的直接抄。</p>
<p dir="auto">文末有選擇決策樹，一看就知道該下哪個。</p>
<p dir="auto">先說結論</p>
<p dir="auto">不用想太多，下面三個閉眼選：</p>
<ul>
<li>24GB+ 卡：Q5_K_M（20.8GB）或 Q6_K（23.5GB），質量接近滿血，不用妥協</li>
<li>16GB 卡：IQ4_XS（15.6GB），全層上 GPU 不 OOM，質量夠用</li>
<li>12GB 卡：IQ3_M（13.9GB）或 IQ3_XS（13.3GB），能跑但明顯降智</li>
</ul>
<p dir="auto">下面展開。</p>
<p dir="auto">為什麼要分這麼多種量化？</p>
<p dir="auto">llama.cpp 的量化不是單純壓縮。它把模型的不同部分（attention 權重、FFN 權重、embedding、output 層）分開用不同精度壓。K-quant 和 I-quant 的核心區別：</p>
<p dir="auto">K-quant（Q4_K_M, Q5_K_M...）：老牌格式，每層用固定 block size 做 K-means 量化。穩定，通用，CPU/GPU 都跑得好。缺點是同等大小下質量不如 I-quant。</p>
<p dir="auto">I-quant（IQ4_XS, IQ3_M...）：重要性矩陣（imatrix）輔助量化，會先跑一批校準數據分析哪些權重更重要，重要的高精度保留，不重要的狠壓。同等大小下質量比 K-quant 好 10-15%，但 CPU 上會慢於 K-quant，需要 cuBLAS/rocBLAS 加速。</p>
<p dir="auto">所以一句話：4-bit 以上隨便選差別不大，4-bit 以下一定要選 I-quant。</p>
<p dir="auto">14 種格式完整對比表</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>量化格式</th>
<th>類型</th>
<th>文件大小</th>
<th>最小 VRAM</th>
<th>質量評級</th>
<th>推薦</th>
</tr>
</thead>
<tbody>
<tr>
<td>Q6_K_L</td>
<td>K-quant</td>
<td>24.1 GB</td>
<td>25 GB</td>
<td>★★★★★ 接近滿血</td>
<td>24G 卡質量首選</td>
</tr>
<tr>
<td>Q6_K</td>
<td>K-quant</td>
<td>23.5 GB</td>
<td>24.5 GB</td>
<td>★★★★★ 接近滿血</td>
<td>24G 卡</td>
</tr>
<tr>
<td>Q5_K_M</td>
<td>K-quant</td>
<td>20.8 GB</td>
<td>22 GB</td>
<td>★★★★☆ 高質量</td>
<td>24G 卡甜點</td>
</tr>
<tr>
<td>Q5_K_S</td>
<td>K-quant</td>
<td>19.7 GB</td>
<td>21 GB</td>
<td>★★★★☆ 高質量</td>
<td>24G 卡省空間</td>
</tr>
<tr>
<td>Q5_K_L</td>
<td>K-quant</td>
<td>21.5 GB</td>
<td>22.5 GB</td>
<td>★★★★☆ embedding 用 Q8</td>
<td>24G 卡</td>
</tr>
<tr>
<td>Q4_K_M</td>
<td>K-quant</td>
<td>17.8 GB</td>
<td>19 GB</td>
<td>★★★★☆ 默認選擇</td>
<td>20G+ 卡通用首選</td>
</tr>
<tr>
<td>Q4_K_L</td>
<td>K-quant</td>
<td>18.7 GB</td>
<td>20 GB</td>
<td>★★★★☆ embedding 用 Q8</td>
<td>20G+ 卡</td>
</tr>
<tr>
<td>Q4_K_S</td>
<td>K-quant</td>
<td>16.7 GB</td>
<td>18 GB</td>
<td>★★★☆☆ 質量略降</td>
<td>16G 卡可跑但緊</td>
</tr>
<tr>
<td>Q4_1</td>
<td>Legacy</td>
<td>17.8 GB</td>
<td>19 GB</td>
<td>★★★☆☆ 老格式</td>
<td>Apple Silicon 有優勢</td>
</tr>
<tr>
<td>Q4_0</td>
<td>Legacy</td>
<td>16.4 GB</td>
<td>18 GB</td>
<td>★★☆☆☆ 老格式</td>
<td>僅兼容性用</td>
</tr>
<tr>
<td>IQ4_XS</td>
<td>I-quant</td>
<td>15.6 GB</td>
<td>16.5 GB</td>
<td>★★★★☆ 質量好</td>
<td>16G 卡全層首選</td>
</tr>
<tr>
<td>IQ4_NL</td>
<td>I-quant</td>
<td>16.3 GB</td>
<td>17 GB</td>
<td>★★★★☆ 略大於IQ4_XS</td>
<td>16G 卡</td>
</tr>
<tr>
<td>IQ3_M</td>
<td>I-quant</td>
<td>13.9 GB</td>
<td>15 GB</td>
<td>★★★☆☆ 可用</td>
<td>12G 卡選擇之一</td>
</tr>
<tr>
<td>IQ3_XS</td>
<td>I-quant</td>
<td>13.3 GB</td>
<td>14.5 GB</td>
<td>★★☆☆☆ 降智明顯</td>
<td>12G 卡</td>
</tr>
<tr>
<td>IQ3_XXS</td>
<td>I-quant</td>
<td>12.6 GB</td>
<td>14 GB</td>
<td>★★☆☆☆ 降智</td>
<td>12G 卡最小可用</td>
</tr>
<tr>
<td>Q3_K_XL</td>
<td>K-quant</td>
<td>16.4 GB</td>
<td>17.5 GB</td>
<td>★★★☆☆ embedding 用 Q8</td>
<td>16G 卡</td>
</tr>
<tr>
<td>Q3_K_L</td>
<td>K-quant</td>
<td>15.3 GB</td>
<td>16.5 GB</td>
<td>★★☆☆☆ 低質量</td>
<td>12G 卡</td>
</tr>
<tr>
<td>Q3_K_M</td>
<td>K-quant</td>
<td>14.6 GB</td>
<td>16 GB</td>
<td>★★☆☆☆ 低質量</td>
<td>不推薦</td>
</tr>
<tr>
<td>Q2_K_L</td>
<td>K-quant</td>
<td>13.1 GB</td>
<td>14.5 GB</td>
<td>★☆☆☆☆ 很低但能跑</td>
<td>純應急</td>
</tr>
<tr>
<td>IQ2_M</td>
<td>I-quant</td>
<td>10.9 GB</td>
<td>12 GB</td>
<td>★☆☆☆☆ SOTA 勉強可用</td>
<td>極端省 VRAM</td>
</tr>
<tr>
<td>IQ2_S</td>
<td>I-quant</td>
<td>10.3 GB</td>
<td>11.5 GB</td>
<td>★☆☆☆☆ 勉強可用</td>
<td>極端省 VRAM</td>
</tr>
<tr>
<td>IQ2_XXS</td>
<td>I-quant</td>
<td>9.4 GB</td>
<td>10.5 GB</td>
<td>☆☆☆☆☆ 有輸出就很難說</td>
<td>純玩</td>
</tr>
</tbody>
</table>
<p dir="auto">註1：最小 VRAM = 權重 + 32K 上下文 KV cache + 推理 overhead。實際需留 1-2 GB 餘量。<br />
註2：質量評級基於 bartowski imatrix 校準版與社區交叉對比，非嚴謹 perplexity 基準。</p>
<p dir="auto">K-quant vs I-quant：到底差多少？</p>
<p dir="auto">論壇上已經有人問過「4-bit 以下到底是 K-quant 還是 I-quant 好」，這裡用 bartowski 的 imatrix 版本數據說明：</p>
<p dir="auto">相同大小對比（4-bit 區間）：</p>
<ul>
<li>Q4_K_S（16.7GB）vs IQ4_XS（15.6GB）：IQ4_XS 小了 1.1GB 但質量評級持平甚至略優。16G 卡首選 IQ4_XS 不是沒有道理的——省出來的 1GB 剛好放 KV cache。</li>
</ul>
<p dir="auto">相同大小對比（3-bit 區間）：</p>
<ul>
<li>Q3_K_M（14.6GB）vs IQ3_M（13.9GB）：I-quant 小 0.7GB 且質量持平。3-bit 以下 I-quant 的優勢更明顯。</li>
<li>Q3_K_S（13.7GB）vs IQ3_XS（13.3GB）：同樣 I-quant 更小且質量略優。</li>
</ul>
<p dir="auto">但 I-quant 有個坑：CPU-only 場景 I-quant 會明顯慢於 K-quant。如果你是純 CPU 跑（沒 GPU），3-bit 以下選 K-quant 反而更順。</p>
<p dir="auto">MTP 與量化的關係</p>
<p dir="auto">Qwen3.8-27B 內建 MTP（Multi-Token Prediction）層，可以做投機解碼。但 MTP 層本身也占 VRAM：</p>
<ul>
<li>MTP 層在 imatrix 量化版中存為 Q4_0，約 1.4GB（不含主模型）</li>
<li>16GB 卡跑 IQ4_XS（15.6GB）+ MTP（1.4GB）= 17GB，超 VRAM 會 OOM</li>
<li>24GB 卡跑 Q4_K_M（17.8GB）+ MTP（1.4GB）= 19.2GB，有空間</li>
<li>ggml-org 官方版有獨立的 MTPQ4_0 格式，只含 MTP 層，1.7GB</li>
</ul>
<p dir="auto">所以 MTP 不是免費的午餐。16GB 卡基本告別 MTP，除非你願意把主模型降到 IQ3 來騰空間——但那樣降智的損失遠大於 MTP 帶來的加速。</p>
<p dir="auto">unsloth Dynamic v3.0 vs bartowski imatrix：哪個好？</p>
<p dir="auto">目前 Qwen3.8-27B 有兩大主流量化來源：</p>
<p dir="auto">bartowski：imatrix 校準，校準數據集包含 63% 工具調用對話 + 37% 純文本（583 chunks, 137 組對話）。特點是工具調用場景的量化損失更小。<br />
unsloth：Dynamic v3.0，宣稱同等大小下 top-1% 準確率比其他來源高 10%+。文件大小比 bartowski 略小（例如 UD-Q4_K_M 16.5GB vs bartowski 17.8GB）。</p>
<p dir="auto">對 Agent/工具調用場景：bartowski 的 imatrix 校準更對路，因為校準集就是工具調用對話。<br />
對純文本生成/翻譯：兩者差別不大，unsloth 可能略優。<br />
對 16G 卡極限操作：unsloth Dynamic 版文件略小，多出的 0.3-1GB 能救你一命的時候就會救。</p>
<p dir="auto">我的建議：16G 卡選 unsloth UD-IQ4_XS（14.3GB），比 bartowski IQ4_XS（15.6GB）省 1.3GB 出來給 KV cache 或 MTP。24G+ 卡選 bartowski Q4_K_M 或 Q5_K_M，質量更穩。</p>
<p dir="auto">選擇決策樹</p>
<p dir="auto">你的 VRAM 幾 GB？</p>
<p dir="auto">24GB+：<br />
├─ 追質量 → Q5_K_M（20.8GB）或 Q6_K（23.5GB）<br />
├─ 追速度+MTP → Q4_K_M（17.8GB）+ MTP<br />
└─ 追極限質量 → Q6_K_L（24.1GB，embedding 用 Q8）</p>
<p dir="auto">16GB：<br />
├─ 全層上 GPU → IQ4_XS（15.6GB）或 unsloth UD-IQ4_XS（14.3GB）<br />
├─ 質量優先願 offload → Q4_K_M（17.8GB），-ngl 28-30 配 --cache-ram<br />
└─ 想開 MTP → 不行，OOM。除非降到 IQ3_M（13.9GB）+MTP（1.4GB）= 15.3GB</p>
<p dir="auto">12GB：<br />
├─ 最佳選擇 → IQ3_M（13.9GB）<br />
├─ 省 VRAM → IQ3_XS（13.3GB）<br />
├─ 極限 → IQ3_XXS（12.6GB），但降智明顯<br />
└─ 別開 MTP，VRAM 不夠</p>
<p dir="auto">8GB 及以下：<br />
├─ IQ2_M（10.9GB）勉強能跑，但輸出質量明顯下降<br />
└─ 誠實說：考慮用更小的模型（Qwen3.8-14B），不要硬壓 27B</p>
<p dir="auto">不用 VRAM 算的通用考量</p>
<ol>
<li>Agent/工具調用重度用戶：選 bartowski imatrix 版，校準集就是工具調用對話，量化損失在工具場景最小。</li>
<li>純文本/翻譯/寫作：unsloth Dynamic v3.0 可能略優。</li>
<li>CPU-only（沒 GPU）：K-quant 比 I-quant 快，4-bit 以下差更多。純 CPU 跑 Q4_K_M 好過 IQ4_XS。</li>
<li>Apple Silicon（統一內存）：Q4_1 在 M 系列上有 token/watt 優勢，其他場景推薦 K-quant。</li>
<li>想開 MTP 投機解碼：VRAM 要夠放主模型 + MTP 層（~1.4GB），16G 卡基本告別。</li>
</ol>
<p dir="auto">下載命令</p>
<p dir="auto">bartowski 版：</p>
<pre><code>hf download bartowski/Qwen3.8-27B-GGUF --include "Qwen3.8-27B-IQ4_XS.gguf" --local-dir ./
</code></pre>
<p dir="auto">unsloth Dynamic v3.0 版：</p>
<pre><code>hf download unsloth/Qwen3.8-27B-GGUF --include "Qwen3.8-27B-UD-IQ4_XS.gguf" --local-dir ./
</code></pre>
<p dir="auto">官方 ggml-org 版（只有 Q4_K_M 和 Q8_0）：</p>
<pre><code>hf download ggml-org/Qwen3.8-27B-GGUF --include "*Q4_K_M*" --local-dir ./
</code></pre>
<p dir="auto">MTP 投機解碼（24G+ 卡適用）：</p>
<pre><code>hf download ggml-org/Qwen3.8-27B-GGUF --include "*MTPQ4_0*" --local-dir ./
</code></pre>
<p dir="auto">已知的缺陷</p>
<ol>
<li>Q4_K_M 在 16G 卡上需要 offload 2-4 層到系統內存。decode 速度從 38 t/s 掉到 18-27 t/s，PCIe 頻寬是瓶頸。16G 卡想要全層上 GPU 就選 IQ4_XS。</li>
<li>I-quant 在 CPU-only 場景顯著慢於 K-quant。沒 GPU 加速就別選 I-quant。</li>
<li>MTP 在 Dense 模型上的加速比 MoE 模型低。Qwen3.6 MoE 的 MTP 加速 1.73x，Qwen3.8 Dense 大約 1.35-1.5x。長上下文（&gt;16K）效果進一步遞減。</li>
<li>imatrix 版本的 MTP 層用 Q4_0 量化（非 imatrix 校準），因為校準數據不經過 MTP 層。好事是 Q4_0 速度最快，適合投機解碼。</li>
<li>Q2 以下的格式——說真的，有輸出就已經很難說了。除非你只是一個 demo 證明「能跑」，否則考慮換小模型。</li>
<li>上下文長度直接影響 VRAM：32K KV cache 在 27B 模型上大約吃 1-1.5GB。8K 上下文只要 0.3GB。VRAM 緊張就把上下文砍到 8K-16K。</li>
</ol>
]]></description><link>https://lcz.me/topic/1250/qwen3.8-27b-量化全格式橫評-從-iq2_xxs-到-q6_k-14-種格式誰才是甜點</link><generator>RSS for Node</generator><lastBuildDate>Fri, 21 Aug 2026 23:02:15 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1250.rss" rel="self" type="application/rss+xml"/><pubDate>Fri, 21 Aug 2026 10:00:38 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to Qwen3.8-27B 量化全格式橫評：從 IQ2_XXS 到 Q6_K，14 種格式誰才是甜點？ on Fri, 21 Aug 2026 15:16:22 GMT]]></title><description><![CDATA[<p dir="auto">的确，我用3.8 q6, 和 3.6 q6 来对比，3.8 多了不少细节。。。<br />
Q6_K_P 接近25gb</p>
]]></description><link>https://lcz.me/post/13349</link><guid isPermaLink="true">https://lcz.me/post/13349</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Fri, 21 Aug 2026 15:16:22 GMT</pubDate></item><item><title><![CDATA[Reply to Qwen3.8-27B 量化全格式橫評：從 IQ2_XXS 到 Q6_K，14 種格式誰才是甜點？ on Fri, 21 Aug 2026 14:48:46 GMT]]></title><description><![CDATA[<p dir="auto">我感觉宁可用低一点的量化， 也不要KV cache 太小， 比如我 24G我肯定不会用 Q5的</p>
]]></description><link>https://lcz.me/post/13345</link><guid isPermaLink="true">https://lcz.me/post/13345</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Fri, 21 Aug 2026 14:48:46 GMT</pubDate></item></channel></rss>