近一週論壇上 Qwen3.8-27B 的帖密度很高,但大多聚焦在特定一張卡跑一兩種量化。量化格式選錯,輕則掉智商,重則 OOM 直接跑不起來。這篇把 llama.cpp 目前支援的 14 種格式從 2-bit 到 6-bit 全攤開比,附上文件大小、最小 VRAM、質量評級、適用場景,你找到自己的顯存對應的直接抄。
文末有選擇決策樹,一看就知道該下哪個。
先說結論
不用想太多,下面三個閉眼選:
- 24GB+ 卡:Q5_K_M(20.8GB)或 Q6_K(23.5GB),質量接近滿血,不用妥協
- 16GB 卡:IQ4_XS(15.6GB),全層上 GPU 不 OOM,質量夠用
- 12GB 卡:IQ3_M(13.9GB)或 IQ3_XS(13.3GB),能跑但明顯降智
下面展開。
為什麼要分這麼多種量化?
llama.cpp 的量化不是單純壓縮。它把模型的不同部分(attention 權重、FFN 權重、embedding、output 層)分開用不同精度壓。K-quant 和 I-quant 的核心區別:
K-quant(Q4_K_M, Q5_K_M...):老牌格式,每層用固定 block size 做 K-means 量化。穩定,通用,CPU/GPU 都跑得好。缺點是同等大小下質量不如 I-quant。
I-quant(IQ4_XS, IQ3_M...):重要性矩陣(imatrix)輔助量化,會先跑一批校準數據分析哪些權重更重要,重要的高精度保留,不重要的狠壓。同等大小下質量比 K-quant 好 10-15%,但 CPU 上會慢於 K-quant,需要 cuBLAS/rocBLAS 加速。
所以一句話:4-bit 以上隨便選差別不大,4-bit 以下一定要選 I-quant。
14 種格式完整對比表
| 量化格式 | 類型 | 文件大小 | 最小 VRAM | 質量評級 | 推薦 |
|---|---|---|---|---|---|
| Q6_K_L | K-quant | 24.1 GB | 25 GB | ★★★★★ 接近滿血 | 24G 卡質量首選 |
| Q6_K | K-quant | 23.5 GB | 24.5 GB | ★★★★★ 接近滿血 | 24G 卡 |
| Q5_K_M | K-quant | 20.8 GB | 22 GB | ★★★★☆ 高質量 | 24G 卡甜點 |
| Q5_K_S | K-quant | 19.7 GB | 21 GB | ★★★★☆ 高質量 | 24G 卡省空間 |
| Q5_K_L | K-quant | 21.5 GB | 22.5 GB | ★★★★☆ embedding 用 Q8 | 24G 卡 |
| Q4_K_M | K-quant | 17.8 GB | 19 GB | ★★★★☆ 默認選擇 | 20G+ 卡通用首選 |
| Q4_K_L | K-quant | 18.7 GB | 20 GB | ★★★★☆ embedding 用 Q8 | 20G+ 卡 |
| Q4_K_S | K-quant | 16.7 GB | 18 GB | ★★★☆☆ 質量略降 | 16G 卡可跑但緊 |
| Q4_1 | Legacy | 17.8 GB | 19 GB | ★★★☆☆ 老格式 | Apple Silicon 有優勢 |
| Q4_0 | Legacy | 16.4 GB | 18 GB | ★★☆☆☆ 老格式 | 僅兼容性用 |
| IQ4_XS | I-quant | 15.6 GB | 16.5 GB | ★★★★☆ 質量好 | 16G 卡全層首選 |
| IQ4_NL | I-quant | 16.3 GB | 17 GB | ★★★★☆ 略大於IQ4_XS | 16G 卡 |
| IQ3_M | I-quant | 13.9 GB | 15 GB | ★★★☆☆ 可用 | 12G 卡選擇之一 |
| IQ3_XS | I-quant | 13.3 GB | 14.5 GB | ★★☆☆☆ 降智明顯 | 12G 卡 |
| IQ3_XXS | I-quant | 12.6 GB | 14 GB | ★★☆☆☆ 降智 | 12G 卡最小可用 |
| Q3_K_XL | K-quant | 16.4 GB | 17.5 GB | ★★★☆☆ embedding 用 Q8 | 16G 卡 |
| Q3_K_L | K-quant | 15.3 GB | 16.5 GB | ★★☆☆☆ 低質量 | 12G 卡 |
| Q3_K_M | K-quant | 14.6 GB | 16 GB | ★★☆☆☆ 低質量 | 不推薦 |
| Q2_K_L | K-quant | 13.1 GB | 14.5 GB | ★☆☆☆☆ 很低但能跑 | 純應急 |
| IQ2_M | I-quant | 10.9 GB | 12 GB | ★☆☆☆☆ SOTA 勉強可用 | 極端省 VRAM |
| IQ2_S | I-quant | 10.3 GB | 11.5 GB | ★☆☆☆☆ 勉強可用 | 極端省 VRAM |
| IQ2_XXS | I-quant | 9.4 GB | 10.5 GB | ☆☆☆☆☆ 有輸出就很難說 | 純玩 |
註1:最小 VRAM = 權重 + 32K 上下文 KV cache + 推理 overhead。實際需留 1-2 GB 餘量。
註2:質量評級基於 bartowski imatrix 校準版與社區交叉對比,非嚴謹 perplexity 基準。
K-quant vs I-quant:到底差多少?
論壇上已經有人問過「4-bit 以下到底是 K-quant 還是 I-quant 好」,這裡用 bartowski 的 imatrix 版本數據說明:
相同大小對比(4-bit 區間):
- Q4_K_S(16.7GB)vs IQ4_XS(15.6GB):IQ4_XS 小了 1.1GB 但質量評級持平甚至略優。16G 卡首選 IQ4_XS 不是沒有道理的——省出來的 1GB 剛好放 KV cache。
相同大小對比(3-bit 區間):
- Q3_K_M(14.6GB)vs IQ3_M(13.9GB):I-quant 小 0.7GB 且質量持平。3-bit 以下 I-quant 的優勢更明顯。
- Q3_K_S(13.7GB)vs IQ3_XS(13.3GB):同樣 I-quant 更小且質量略優。
但 I-quant 有個坑:CPU-only 場景 I-quant 會明顯慢於 K-quant。如果你是純 CPU 跑(沒 GPU),3-bit 以下選 K-quant 反而更順。
MTP 與量化的關係
Qwen3.8-27B 內建 MTP(Multi-Token Prediction)層,可以做投機解碼。但 MTP 層本身也占 VRAM:
- MTP 層在 imatrix 量化版中存為 Q4_0,約 1.4GB(不含主模型)
- 16GB 卡跑 IQ4_XS(15.6GB)+ MTP(1.4GB)= 17GB,超 VRAM 會 OOM
- 24GB 卡跑 Q4_K_M(17.8GB)+ MTP(1.4GB)= 19.2GB,有空間
- ggml-org 官方版有獨立的 MTPQ4_0 格式,只含 MTP 層,1.7GB
所以 MTP 不是免費的午餐。16GB 卡基本告別 MTP,除非你願意把主模型降到 IQ3 來騰空間——但那樣降智的損失遠大於 MTP 帶來的加速。
unsloth Dynamic v3.0 vs bartowski imatrix:哪個好?
目前 Qwen3.8-27B 有兩大主流量化來源:
bartowski:imatrix 校準,校準數據集包含 63% 工具調用對話 + 37% 純文本(583 chunks, 137 組對話)。特點是工具調用場景的量化損失更小。
unsloth:Dynamic v3.0,宣稱同等大小下 top-1% 準確率比其他來源高 10%+。文件大小比 bartowski 略小(例如 UD-Q4_K_M 16.5GB vs bartowski 17.8GB)。
對 Agent/工具調用場景:bartowski 的 imatrix 校準更對路,因為校準集就是工具調用對話。
對純文本生成/翻譯:兩者差別不大,unsloth 可能略優。
對 16G 卡極限操作:unsloth Dynamic 版文件略小,多出的 0.3-1GB 能救你一命的時候就會救。
我的建議:16G 卡選 unsloth UD-IQ4_XS(14.3GB),比 bartowski IQ4_XS(15.6GB)省 1.3GB 出來給 KV cache 或 MTP。24G+ 卡選 bartowski Q4_K_M 或 Q5_K_M,質量更穩。
選擇決策樹
你的 VRAM 幾 GB?
24GB+:
├─ 追質量 → Q5_K_M(20.8GB)或 Q6_K(23.5GB)
├─ 追速度+MTP → Q4_K_M(17.8GB)+ MTP
└─ 追極限質量 → Q6_K_L(24.1GB,embedding 用 Q8)
16GB:
├─ 全層上 GPU → IQ4_XS(15.6GB)或 unsloth UD-IQ4_XS(14.3GB)
├─ 質量優先願 offload → Q4_K_M(17.8GB),-ngl 28-30 配 --cache-ram
└─ 想開 MTP → 不行,OOM。除非降到 IQ3_M(13.9GB)+MTP(1.4GB)= 15.3GB
12GB:
├─ 最佳選擇 → IQ3_M(13.9GB)
├─ 省 VRAM → IQ3_XS(13.3GB)
├─ 極限 → IQ3_XXS(12.6GB),但降智明顯
└─ 別開 MTP,VRAM 不夠
8GB 及以下:
├─ IQ2_M(10.9GB)勉強能跑,但輸出質量明顯下降
└─ 誠實說:考慮用更小的模型(Qwen3.8-14B),不要硬壓 27B
不用 VRAM 算的通用考量
- Agent/工具調用重度用戶:選 bartowski imatrix 版,校準集就是工具調用對話,量化損失在工具場景最小。
- 純文本/翻譯/寫作:unsloth Dynamic v3.0 可能略優。
- CPU-only(沒 GPU):K-quant 比 I-quant 快,4-bit 以下差更多。純 CPU 跑 Q4_K_M 好過 IQ4_XS。
- Apple Silicon(統一內存):Q4_1 在 M 系列上有 token/watt 優勢,其他場景推薦 K-quant。
- 想開 MTP 投機解碼:VRAM 要夠放主模型 + MTP 層(~1.4GB),16G 卡基本告別。
下載命令
bartowski 版:
hf download bartowski/Qwen3.8-27B-GGUF --include "Qwen3.8-27B-IQ4_XS.gguf" --local-dir ./
unsloth Dynamic v3.0 版:
hf download unsloth/Qwen3.8-27B-GGUF --include "Qwen3.8-27B-UD-IQ4_XS.gguf" --local-dir ./
官方 ggml-org 版(只有 Q4_K_M 和 Q8_0):
hf download ggml-org/Qwen3.8-27B-GGUF --include "*Q4_K_M*" --local-dir ./
MTP 投機解碼(24G+ 卡適用):
hf download ggml-org/Qwen3.8-27B-GGUF --include "*MTPQ4_0*" --local-dir ./
已知的缺陷
- Q4_K_M 在 16G 卡上需要 offload 2-4 層到系統內存。decode 速度從 38 t/s 掉到 18-27 t/s,PCIe 頻寬是瓶頸。16G 卡想要全層上 GPU 就選 IQ4_XS。
- I-quant 在 CPU-only 場景顯著慢於 K-quant。沒 GPU 加速就別選 I-quant。
- MTP 在 Dense 模型上的加速比 MoE 模型低。Qwen3.6 MoE 的 MTP 加速 1.73x,Qwen3.8 Dense 大約 1.35-1.5x。長上下文(>16K)效果進一步遞減。
- imatrix 版本的 MTP 層用 Q4_0 量化(非 imatrix 校準),因為校準數據不經過 MTP 層。好事是 Q4_0 速度最快,適合投機解碼。
- Q2 以下的格式——說真的,有輸出就已經很難說了。除非你只是一個 demo 證明「能跑」,否則考慮換小模型。
- 上下文長度直接影響 VRAM:32K KV cache 在 27B 模型上大約吃 1-1.5GB。8K 上下文只要 0.3GB。VRAM 緊張就把上下文砍到 8K-16K。

(IQ4_XS)
️ 勉強
慢