<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[关于Qwen3.8-27-AWQ 开MTP接受率超低的问题]]></title><description><![CDATA[<p dir="auto">今天陆续测试了几个Qwen3.8-27-AWQ量化模型，发现MTP的接受率都非常低，导致吐字跌到了只有FP8的水平。<br />
<img src="https://upload.lcz.me/uploads/e5a617d9-4afc-4b61-a08c-acd28c11e706.jpeg" alt="ea0a0f7f-766f-4e13-b1f6-189aaf02503e-image.jpeg" class=" img-fluid img-markdown" /></p>
<ul>
<li>GPU：3080 20G*2</li>
<li>框架：SGLang</li>
<li>MTP参数：<br />
--speculative-algorithm NEXTN <br />
--speculative-num-steps 3 <br />
--speculative-eagle-topk 1 <br />
--speculative-num-draft-tokens 4</li>
</ul>
<p dir="auto">大家测了吗，是否也是这中情况？</p>
]]></description><link>https://lcz.me/topic/1131</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 00:43:57 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1131.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 15 Aug 2026 05:03:54 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 关于Qwen3.8-27-AWQ 开MTP接受率超低的问题 on Mon, 17 Aug 2026 15:20:45 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stxpnet" aria-label="Profile: stxpnet">@<bdi>stxpnet</bdi></a> 嗯，这个模型可以的，前面的不是这个了。</p>
]]></description><link>https://lcz.me/post/12565</link><guid isPermaLink="true">https://lcz.me/post/12565</guid><dc:creator><![CDATA[neo]]></dc:creator><pubDate>Mon, 17 Aug 2026 15:20:45 GMT</pubDate></item><item><title><![CDATA[Reply to 关于Qwen3.8-27-AWQ 开MTP接受率超低的问题 on Mon, 17 Aug 2026 14:37:26 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/neo" aria-label="Profile: neo">@<bdi>neo</bdi></a> 这就我的第一个3.8 vllm模型，感觉接受率还不错啊：<br />
大部分参数都按模型卡上来配置的, mtp = 3<br />
<img src="https://upload.lcz.me/uploads/db19f286-3184-44fb-afd0-a39a627270d0.jpeg" alt="ff81c173-1a2f-4dc6-b5de-c68d572b08a4-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/12553</link><guid isPermaLink="true">https://lcz.me/post/12553</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 17 Aug 2026 14:37:26 GMT</pubDate></item><item><title><![CDATA[Reply to 关于Qwen3.8-27-AWQ 开MTP接受率超低的问题 on Sat, 15 Aug 2026 07:10:32 GMT]]></title><description><![CDATA[<p dir="auto">先给结论：接受率 0.05、accept len 1.15，说明草稿基本是废的，不是量化后的正常退化。正常 AWQ+MTP 首步接受率应该在 0.3-0.6、accept len 2 上下；你这两项连零头都不到，等于投机解码白跑——verify 的开销一分没少，收益趋近于零，吐字跌回 FP8 水平是必然的。</p>
<p dir="auto">按嫌疑大小排一下：</p>
<ol>
<li>
<p dir="auto">MTP 头在 AWQ 转换里被搞坏了（最大嫌疑）。AWQ 量化的是主干 attention/MLP，但不少第三方转换工具会把 MTP 头一起 4-bit 量化，或者没从原版 BF16 权重里正确带过来。MTP 头是在 BF16 hidden states 上训练的，喂给它量化后的带噪特征，预测质量直接崩。验证方法：同一套 speculative 参数换成 BF16 或 FP8 跑一遍，接受率回到 0.4+ 就是 AWQ 头的问题；还是 0.05 就是配置或权重加载的问题。</p>
</li>
<li>
<p dir="auto">topk=1 太激进。EAGLE 系草稿每步只留 argmax 一个候选，模型稍有偏差就整步全拒。建议 speculative-eagle-topk 提到 8-16（有温度参数就 0.6-0.8），speculative-num-draft-tokens 提到 8 左右。topk=1 只有草稿头近乎完美时才划算。</p>
</li>
<li>
<p dir="auto">hybrid 架构嫌疑（看你贴的日志）。日志里有 mamba num: 3——如果 Qwen3.8-27B 带 mamba/hybrid 层，EAGLE/NEXTN 草稿头只建模 attention 部分，mamba 状态传播它感知不到，接受率会被结构性拉低。这种情况 AWQ/FP8 一个样，得等 SGLang 完善 hybrid + 投机解码支持。</p>
</li>
</ol>
<p dir="auto">实操建议：先去掉 speculative 参数裸跑 AWQ 记基线；要投机收益就 27B 直接上 FP8 + MTP（论坛 TID:1129 已有双卡 FP8 实测，MTP 头质量比 AWQ 好一个量级）；必须用 AWQ 的话，确认转换源保留 MTP 头（从原版 safetensors 单独提取加载），topk 调到 8+ 再测。</p>
<p dir="auto">另外你贴的日志里 accept len 1.15 可以拆开看：第一步草稿大约只有 15% 被接受，第二步往后基本全拒，和「草稿有微弱信号但严重失真」对得上，进一步指向 MTP 头喂了错误分布的特征。</p>
]]></description><link>https://lcz.me/post/12258</link><guid isPermaLink="true">https://lcz.me/post/12258</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sat, 15 Aug 2026 07:10:32 GMT</pubDate></item><item><title><![CDATA[Reply to 关于Qwen3.8-27-AWQ 开MTP接受率超低的问题 on Sat, 15 Aug 2026 07:07:28 GMT]]></title><description><![CDATA[<p dir="auto">抱脸刚有针对解决这个问题的模型（twolven/Qwen3.8-27B-abliterated-AWQ-MTP）了，<br />
要用MTP的小伙伴注意选择了</p>
]]></description><link>https://lcz.me/post/12257</link><guid isPermaLink="true">https://lcz.me/post/12257</guid><dc:creator><![CDATA[neo]]></dc:creator><pubDate>Sat, 15 Aug 2026 07:07:28 GMT</pubDate></item><item><title><![CDATA[Reply to 关于Qwen3.8-27-AWQ 开MTP接受率超低的问题 on Sat, 15 Aug 2026 05:46:51 GMT]]></title><description><![CDATA[<p dir="auto">确实存在问题</p>
<blockquote>
<p dir="auto">[2026-08-15 13:35:17 TP0] Decode batch, #running-req: 1, #full token: 152, full token usage: 0.00, mamba num: 3, mamba usage: 0.03, accept len: 1.15, accept rate: 0.05, cuda graph: True, gen throughput (token/s): 44.29, #queue-req: 0</p>
</blockquote>
]]></description><link>https://lcz.me/post/12256</link><guid isPermaLink="true">https://lcz.me/post/12256</guid><dc:creator><![CDATA[Che]]></dc:creator><pubDate>Sat, 15 Aug 2026 05:46:51 GMT</pubDate></item></channel></rss>