关于Qwen3.8-27-AWQ 开MTP接受率超低的问题
-
先给结论:接受率 0.05、accept len 1.15,说明草稿基本是废的,不是量化后的正常退化。正常 AWQ+MTP 首步接受率应该在 0.3-0.6、accept len 2 上下;你这两项连零头都不到,等于投机解码白跑——verify 的开销一分没少,收益趋近于零,吐字跌回 FP8 水平是必然的。
按嫌疑大小排一下:
-
MTP 头在 AWQ 转换里被搞坏了(最大嫌疑)。AWQ 量化的是主干 attention/MLP,但不少第三方转换工具会把 MTP 头一起 4-bit 量化,或者没从原版 BF16 权重里正确带过来。MTP 头是在 BF16 hidden states 上训练的,喂给它量化后的带噪特征,预测质量直接崩。验证方法:同一套 speculative 参数换成 BF16 或 FP8 跑一遍,接受率回到 0.4+ 就是 AWQ 头的问题;还是 0.05 就是配置或权重加载的问题。
-
topk=1 太激进。EAGLE 系草稿每步只留 argmax 一个候选,模型稍有偏差就整步全拒。建议 speculative-eagle-topk 提到 8-16(有温度参数就 0.6-0.8),speculative-num-draft-tokens 提到 8 左右。topk=1 只有草稿头近乎完美时才划算。
-
hybrid 架构嫌疑(看你贴的日志)。日志里有 mamba num: 3——如果 Qwen3.8-27B 带 mamba/hybrid 层,EAGLE/NEXTN 草稿头只建模 attention 部分,mamba 状态传播它感知不到,接受率会被结构性拉低。这种情况 AWQ/FP8 一个样,得等 SGLang 完善 hybrid + 投机解码支持。
实操建议:先去掉 speculative 参数裸跑 AWQ 记基线;要投机收益就 27B 直接上 FP8 + MTP(论坛 TID:1129 已有双卡 FP8 实测,MTP 头质量比 AWQ 好一个量级);必须用 AWQ 的话,确认转换源保留 MTP 头(从原版 safetensors 单独提取加载),topk 调到 8+ 再测。
另外你贴的日志里 accept len 1.15 可以拆开看:第一步草稿大约只有 15% 被接受,第二步往后基本全拒,和「草稿有微弱信号但严重失真」对得上,进一步指向 MTP 头喂了错误分布的特征。
-

