跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. 资讯
  4. Qwen3.8-27B 量化全格式橫評:從 IQ2_XXS 到 Q6_K,14 種格式誰才是甜點?

Qwen3.8-27B 量化全格式橫評:從 IQ2_XXS 到 Q6_K,14 種格式誰才是甜點?

已定时 已固定 已锁定 已移动 资讯
qwen-27b量化llama.cpp
3 帖子 3 发布者 78 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • 王池川王 离线
    王池川王 离线
    王池川
    编写于 最后由 编辑
    #1

    近一週論壇上 Qwen3.8-27B 的帖密度很高,但大多聚焦在特定一張卡跑一兩種量化。量化格式選錯,輕則掉智商,重則 OOM 直接跑不起來。這篇把 llama.cpp 目前支援的 14 種格式從 2-bit 到 6-bit 全攤開比,附上文件大小、最小 VRAM、質量評級、適用場景,你找到自己的顯存對應的直接抄。

    文末有選擇決策樹,一看就知道該下哪個。

    先說結論

    不用想太多,下面三個閉眼選:

    • 24GB+ 卡:Q5_K_M(20.8GB)或 Q6_K(23.5GB),質量接近滿血,不用妥協
    • 16GB 卡:IQ4_XS(15.6GB),全層上 GPU 不 OOM,質量夠用
    • 12GB 卡:IQ3_M(13.9GB)或 IQ3_XS(13.3GB),能跑但明顯降智

    下面展開。

    為什麼要分這麼多種量化?

    llama.cpp 的量化不是單純壓縮。它把模型的不同部分(attention 權重、FFN 權重、embedding、output 層)分開用不同精度壓。K-quant 和 I-quant 的核心區別:

    K-quant(Q4_K_M, Q5_K_M...):老牌格式,每層用固定 block size 做 K-means 量化。穩定,通用,CPU/GPU 都跑得好。缺點是同等大小下質量不如 I-quant。

    I-quant(IQ4_XS, IQ3_M...):重要性矩陣(imatrix)輔助量化,會先跑一批校準數據分析哪些權重更重要,重要的高精度保留,不重要的狠壓。同等大小下質量比 K-quant 好 10-15%,但 CPU 上會慢於 K-quant,需要 cuBLAS/rocBLAS 加速。

    所以一句話:4-bit 以上隨便選差別不大,4-bit 以下一定要選 I-quant。

    14 種格式完整對比表

    量化格式 類型 文件大小 最小 VRAM 質量評級 推薦
    Q6_K_L K-quant 24.1 GB 25 GB ★★★★★ 接近滿血 24G 卡質量首選
    Q6_K K-quant 23.5 GB 24.5 GB ★★★★★ 接近滿血 24G 卡
    Q5_K_M K-quant 20.8 GB 22 GB ★★★★☆ 高質量 24G 卡甜點
    Q5_K_S K-quant 19.7 GB 21 GB ★★★★☆ 高質量 24G 卡省空間
    Q5_K_L K-quant 21.5 GB 22.5 GB ★★★★☆ embedding 用 Q8 24G 卡
    Q4_K_M K-quant 17.8 GB 19 GB ★★★★☆ 默認選擇 20G+ 卡通用首選
    Q4_K_L K-quant 18.7 GB 20 GB ★★★★☆ embedding 用 Q8 20G+ 卡
    Q4_K_S K-quant 16.7 GB 18 GB ★★★☆☆ 質量略降 16G 卡可跑但緊
    Q4_1 Legacy 17.8 GB 19 GB ★★★☆☆ 老格式 Apple Silicon 有優勢
    Q4_0 Legacy 16.4 GB 18 GB ★★☆☆☆ 老格式 僅兼容性用
    IQ4_XS I-quant 15.6 GB 16.5 GB ★★★★☆ 質量好 16G 卡全層首選
    IQ4_NL I-quant 16.3 GB 17 GB ★★★★☆ 略大於IQ4_XS 16G 卡
    IQ3_M I-quant 13.9 GB 15 GB ★★★☆☆ 可用 12G 卡選擇之一
    IQ3_XS I-quant 13.3 GB 14.5 GB ★★☆☆☆ 降智明顯 12G 卡
    IQ3_XXS I-quant 12.6 GB 14 GB ★★☆☆☆ 降智 12G 卡最小可用
    Q3_K_XL K-quant 16.4 GB 17.5 GB ★★★☆☆ embedding 用 Q8 16G 卡
    Q3_K_L K-quant 15.3 GB 16.5 GB ★★☆☆☆ 低質量 12G 卡
    Q3_K_M K-quant 14.6 GB 16 GB ★★☆☆☆ 低質量 不推薦
    Q2_K_L K-quant 13.1 GB 14.5 GB ★☆☆☆☆ 很低但能跑 純應急
    IQ2_M I-quant 10.9 GB 12 GB ★☆☆☆☆ SOTA 勉強可用 極端省 VRAM
    IQ2_S I-quant 10.3 GB 11.5 GB ★☆☆☆☆ 勉強可用 極端省 VRAM
    IQ2_XXS I-quant 9.4 GB 10.5 GB ☆☆☆☆☆ 有輸出就很難說 純玩

    註1:最小 VRAM = 權重 + 32K 上下文 KV cache + 推理 overhead。實際需留 1-2 GB 餘量。
    註2:質量評級基於 bartowski imatrix 校準版與社區交叉對比,非嚴謹 perplexity 基準。

    K-quant vs I-quant:到底差多少?

    論壇上已經有人問過「4-bit 以下到底是 K-quant 還是 I-quant 好」,這裡用 bartowski 的 imatrix 版本數據說明:

    相同大小對比(4-bit 區間):

    • Q4_K_S(16.7GB)vs IQ4_XS(15.6GB):IQ4_XS 小了 1.1GB 但質量評級持平甚至略優。16G 卡首選 IQ4_XS 不是沒有道理的——省出來的 1GB 剛好放 KV cache。

    相同大小對比(3-bit 區間):

    • Q3_K_M(14.6GB)vs IQ3_M(13.9GB):I-quant 小 0.7GB 且質量持平。3-bit 以下 I-quant 的優勢更明顯。
    • Q3_K_S(13.7GB)vs IQ3_XS(13.3GB):同樣 I-quant 更小且質量略優。

    但 I-quant 有個坑:CPU-only 場景 I-quant 會明顯慢於 K-quant。如果你是純 CPU 跑(沒 GPU),3-bit 以下選 K-quant 反而更順。

    MTP 與量化的關係

    Qwen3.8-27B 內建 MTP(Multi-Token Prediction)層,可以做投機解碼。但 MTP 層本身也占 VRAM:

    • MTP 層在 imatrix 量化版中存為 Q4_0,約 1.4GB(不含主模型)
    • 16GB 卡跑 IQ4_XS(15.6GB)+ MTP(1.4GB)= 17GB,超 VRAM 會 OOM
    • 24GB 卡跑 Q4_K_M(17.8GB)+ MTP(1.4GB)= 19.2GB,有空間
    • ggml-org 官方版有獨立的 MTPQ4_0 格式,只含 MTP 層,1.7GB

    所以 MTP 不是免費的午餐。16GB 卡基本告別 MTP,除非你願意把主模型降到 IQ3 來騰空間——但那樣降智的損失遠大於 MTP 帶來的加速。

    unsloth Dynamic v3.0 vs bartowski imatrix:哪個好?

    目前 Qwen3.8-27B 有兩大主流量化來源:

    bartowski:imatrix 校準,校準數據集包含 63% 工具調用對話 + 37% 純文本(583 chunks, 137 組對話)。特點是工具調用場景的量化損失更小。
    unsloth:Dynamic v3.0,宣稱同等大小下 top-1% 準確率比其他來源高 10%+。文件大小比 bartowski 略小(例如 UD-Q4_K_M 16.5GB vs bartowski 17.8GB)。

    對 Agent/工具調用場景:bartowski 的 imatrix 校準更對路,因為校準集就是工具調用對話。
    對純文本生成/翻譯:兩者差別不大,unsloth 可能略優。
    對 16G 卡極限操作:unsloth Dynamic 版文件略小,多出的 0.3-1GB 能救你一命的時候就會救。

    我的建議:16G 卡選 unsloth UD-IQ4_XS(14.3GB),比 bartowski IQ4_XS(15.6GB)省 1.3GB 出來給 KV cache 或 MTP。24G+ 卡選 bartowski Q4_K_M 或 Q5_K_M,質量更穩。

    選擇決策樹

    你的 VRAM 幾 GB?

    24GB+:
    ├─ 追質量 → Q5_K_M(20.8GB)或 Q6_K(23.5GB)
    ├─ 追速度+MTP → Q4_K_M(17.8GB)+ MTP
    └─ 追極限質量 → Q6_K_L(24.1GB,embedding 用 Q8)

    16GB:
    ├─ 全層上 GPU → IQ4_XS(15.6GB)或 unsloth UD-IQ4_XS(14.3GB)
    ├─ 質量優先願 offload → Q4_K_M(17.8GB),-ngl 28-30 配 --cache-ram
    └─ 想開 MTP → 不行,OOM。除非降到 IQ3_M(13.9GB)+MTP(1.4GB)= 15.3GB

    12GB:
    ├─ 最佳選擇 → IQ3_M(13.9GB)
    ├─ 省 VRAM → IQ3_XS(13.3GB)
    ├─ 極限 → IQ3_XXS(12.6GB),但降智明顯
    └─ 別開 MTP,VRAM 不夠

    8GB 及以下:
    ├─ IQ2_M(10.9GB)勉強能跑,但輸出質量明顯下降
    └─ 誠實說:考慮用更小的模型(Qwen3.8-14B),不要硬壓 27B

    不用 VRAM 算的通用考量

    1. Agent/工具調用重度用戶:選 bartowski imatrix 版,校準集就是工具調用對話,量化損失在工具場景最小。
    2. 純文本/翻譯/寫作:unsloth Dynamic v3.0 可能略優。
    3. CPU-only(沒 GPU):K-quant 比 I-quant 快,4-bit 以下差更多。純 CPU 跑 Q4_K_M 好過 IQ4_XS。
    4. Apple Silicon(統一內存):Q4_1 在 M 系列上有 token/watt 優勢,其他場景推薦 K-quant。
    5. 想開 MTP 投機解碼:VRAM 要夠放主模型 + MTP 層(~1.4GB),16G 卡基本告別。

    下載命令

    bartowski 版:

    hf download bartowski/Qwen3.8-27B-GGUF --include "Qwen3.8-27B-IQ4_XS.gguf" --local-dir ./
    

    unsloth Dynamic v3.0 版:

    hf download unsloth/Qwen3.8-27B-GGUF --include "Qwen3.8-27B-UD-IQ4_XS.gguf" --local-dir ./
    

    官方 ggml-org 版(只有 Q4_K_M 和 Q8_0):

    hf download ggml-org/Qwen3.8-27B-GGUF --include "*Q4_K_M*" --local-dir ./
    

    MTP 投機解碼(24G+ 卡適用):

    hf download ggml-org/Qwen3.8-27B-GGUF --include "*MTPQ4_0*" --local-dir ./
    

    已知的缺陷

    1. Q4_K_M 在 16G 卡上需要 offload 2-4 層到系統內存。decode 速度從 38 t/s 掉到 18-27 t/s,PCIe 頻寬是瓶頸。16G 卡想要全層上 GPU 就選 IQ4_XS。
    2. I-quant 在 CPU-only 場景顯著慢於 K-quant。沒 GPU 加速就別選 I-quant。
    3. MTP 在 Dense 模型上的加速比 MoE 模型低。Qwen3.6 MoE 的 MTP 加速 1.73x,Qwen3.8 Dense 大約 1.35-1.5x。長上下文(>16K)效果進一步遞減。
    4. imatrix 版本的 MTP 層用 Q4_0 量化(非 imatrix 校準),因為校準數據不經過 MTP 層。好事是 Q4_0 速度最快,適合投機解碼。
    5. Q2 以下的格式——說真的,有輸出就已經很難說了。除非你只是一個 demo 證明「能跑」,否則考慮換小模型。
    6. 上下文長度直接影響 VRAM:32K KV cache 在 27B 模型上大約吃 1-1.5GB。8K 上下文只要 0.3GB。VRAM 緊張就把上下文砍到 8K-16K。
    1 条回复 最后回复
    2
    • J 离线
      J 离线
      johnnybegood
      劳动模范 技术大牛
      编写于 最后由 编辑
      #2

      我感觉宁可用低一点的量化, 也不要KV cache 太小, 比如我 24G我肯定不会用 Q5的

      1 条回复 最后回复
      1
      • imbiplaza ASUSI 离线
        imbiplaza ASUSI 离线
        imbiplaza ASUS
        超凡大师
        编写于 最后由 编辑
        #3

        的确,我用3.8 q6, 和 3.6 q6 来对比,3.8 多了不少细节。。。
        Q6_K_P 接近25gb

        1 条回复 最后回复
        0

        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

        有了你的建议,这篇帖子会更精彩哦 💗

        注册 登录
        回复
        • 在新帖中回复
        登录后回复
        • 从旧到新
        • 从新到旧
        • 最多赞同


        • 登录

        • 没有帐号? 注册

        • 登录或注册以进行搜索。
        • 第一个帖子
          最后一个帖子
        0
        • 版块
        • 最新
        • 标签
        • 热门
        • 用户
        • 群组