<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[AMD 官方 MXFP4与社区 INT4，两个量化版本深度评测]]></title><description><![CDATA[<h1>Qwen3.8-27B 两个量化版本深度评测</h1>
<blockquote>
<p dir="auto">对比对象：<code>devan-carlin/Qwen3.8-27B-int4-AutoRound</code>（社区 INT4）vs <code>amd/Qwen3.8-27B-Quark-AWQ-MXFP4</code>（AMD 官方 MXFP4）<br />
测试硬件：AMD Radeon AI PRO R9700（32GB，单卡）</p>
</blockquote>
<hr />
<h2>1. 结论速览</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>维度</th>
<th>结论</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>模型本体</strong></td>
<td>Qwen3.8-27B 是阿里 Qwen 的 27B 原生多模态（视觉+语言+视频）模型，主打 <strong>Agent / 编码 / 研究</strong></td>
</tr>
<tr>
<td><strong>两个量化版质量</strong></td>
<td>都很高，GSM8K 恢复率 99%~102%，日常使用几乎无损</td>
</tr>
<tr>
<td><strong>INT4（AutoRound）</strong></td>
<td>约 18GB，社区实测质量略优，<strong>部署最顺</strong>（我们已跑通）</td>
</tr>
<tr>
<td><strong>MXFP4（AMD 官方）</strong></td>
<td>约 14GB，更小，但有 <strong>MTP 头 BF16 未量化的已知 bug</strong>，需要额外预处理</td>
</tr>
<tr>
<td><strong>实测速度</strong></td>
<td>本机 37~61 tok/s（无思考 37、含思考 55~61）</td>
</tr>
<tr>
<td><strong>最主要场景</strong></td>
<td><strong>AI 智能体（Agent）+ 编码 + 多模态办公</strong></td>
</tr>
</tbody>
</table>
<hr />
<h2>2. 模型基础：Qwen3.8-27B 是什么</h2>
<p dir="auto">Qwen3.8-27B 是阿里 Qwen 团队基于 <strong>Qwen3.5 架构</strong>推出的 27B 稠密模型，官方定位：</p>
<blockquote>
<p dir="auto">"在编码、专业工作、研究、长程智能体任务上带来大幅提升的紧凑、易部署的<strong>原生视觉语言模型</strong>。"</p>
</blockquote>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>属性</th>
<th>值</th>
</tr>
</thead>
<tbody>
<tr>
<td>参数量</td>
<td>27B（稠密）</td>
</tr>
<tr>
<td>隐藏维度</td>
<td>5120</td>
</tr>
<tr>
<td>层数</td>
<td>64 层</td>
</tr>
<tr>
<td>上下文</td>
<td>原生 262,144（256K），可扩展至 100 万</td>
</tr>
<tr>
<td>模态</td>
<td>文本 + 图片 + 视频（原生）</td>
</tr>
<tr>
<td>思考控制</td>
<td>默认开启思考，可关闭，<code>reasoning_effort</code> 可调</td>
</tr>
<tr>
<td>协议</td>
<td>Apache-2.0</td>
</tr>
</tbody>
</table>
<h3>官方列出的核心能力</h3>
<ol>
<li><strong>Core Capabilities</strong>：编码、专业工作、研究、长程智能体的全面提升</li>
<li><strong>Agent Execution</strong>：更强的自主规划与环境反馈处理，端到端任务完成更可靠</li>
<li><strong>Flexible Thinking Control</strong>：思考模式默认开、可按请求关，推理深度可调</li>
<li><strong>Vision-Language Understanding</strong>：原生图片/视频理解（从 STEM 图表、文档到小时级视频）</li>
</ol>
<hr />
<h2>3. 架构详解（GDN 混合架构）</h2>
<p dir="auto">Qwen3.8-27B 采用 <strong>Gated DeltaNet（GDN）混合架构</strong>——线性注意力与全注意力的混合，这是它"小而强"的关键：</p>
<pre><code>隐藏布局：16 × ( 3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN) )
</code></pre>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>结构</th>
<th>数量</th>
<th>说明</th>
</tr>
</thead>
<tbody>
<tr>
<td>线性注意力头（GDN）</td>
<td>48（V）/ 16（QK）</td>
<td>长程记忆，高效处理长上下文</td>
</tr>
<tr>
<td>全注意力头（Gated Attention）</td>
<td>24（Q）/ 4（KV）</td>
<td>精确局部注意力</td>
</tr>
<tr>
<td>混合比例</td>
<td>3:1（线性:全注意）</td>
<td>每 4 层中 3 层线性 + 1 层全注意</td>
</tr>
</tbody>
</table>
<p dir="auto"><strong>架构意义</strong>：</p>
<ul>
<li>线性注意力（DeltaNet）让 27B 模型在 256K 甚至 100 万 token 长上下文下仍保持高效</li>
<li>全注意力层保留复杂推理的精确性</li>
<li>因此它特别适合<strong>长程 Agent 任务</strong>（多步规划、环境反馈、长文档）</li>
</ul>
<hr />
<h2>4. 两个量化版本逐项对比</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>维度</th>
<th>AutoRound INT4 （社区）</th>
<th>AMD Quark AWQ MXFP4 （官方）</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>量化工具</strong></td>
<td>Intel AutoRound</td>
<td>AMD Quark</td>
</tr>
<tr>
<td><strong>权重精度</strong></td>
<td>INT4（W4）</td>
<td>MXFP4（OCP 微缩放 FP4）</td>
</tr>
<tr>
<td><strong>激活精度</strong></td>
<td>FP16（W4A16）</td>
<td>MXFP4（动态）</td>
</tr>
<tr>
<td><strong>分组大小</strong></td>
<td>group 128</td>
<td>group 32（E8M0 共享缩放）</td>
</tr>
<tr>
<td><strong>算法</strong></td>
<td>AutoRound（对称）</td>
<td>AWQ（激活感知）</td>
</tr>
<tr>
<td><strong>校准集</strong></td>
<td>—</td>
<td>pileval（128 样本）</td>
</tr>
<tr>
<td><strong>体积</strong></td>
<td>~18 GB</td>
<td>~14 GB</td>
</tr>
<tr>
<td><strong>视觉塔</strong></td>
<td>bf16（未量化）</td>
<td>bf16（未量化，模型卡明确说明）</td>
</tr>
<tr>
<td><strong>MTP 投机头</strong></td>
<td>INT4（已正确量化）</td>
<td>BF16（未量化，有加载 bug）</td>
</tr>
<tr>
<td><strong>官方 GSM8K 恢复率</strong></td>
<td>社区实测"优于 AMD 两个 Quark 版"</td>
<td>101.8%（思考）/ 99.2%（无思考）</td>
</tr>
<tr>
<td><strong>部署难度</strong></td>
<td>需 config 补丁 + 内核补丁</td>
<td>需预处理 MTP 头 + MXFP4 内核</td>
</tr>
<tr>
<td><strong>单卡 32GB 适配</strong></td>
<td>17.9GB，宽裕</td>
<td>~16GB，更宽裕</td>
</tr>
</tbody>
</table>
<h3>关键差异解读</h3>
<ol>
<li><strong>体积</strong>：MXFP4 更小（14GB vs 18GB），因为激活也量化了。</li>
<li><strong>质量</strong>：两者都接近无损。AMD 官方 GSM8K 恢复率 &gt;99%；社区（zzpanic launcher）实测 AutoRound INT4 "beats AMD's two published Quark checkpoints"。两个说法不矛盾——各自基准不同。</li>
<li><strong>致命差异是部署</strong>：AMD MXFP4 的 <strong>MTP 头未量化（BF16）</strong>，其 exclude 列表用了 tensor 名而非 module 名，导致 quark 没排除 mtp 层，vLLM 加载会报 <code>asserts on a half-width parameter</code>——需用脚本 <code>fp8_mtp.py</code> 重新量化 MTP 头才能跑。而 AutoRound INT4 的 MTP 头已正确 INT4 量化，<strong>开箱即用</strong>（加 config 补丁即可）。</li>
</ol>
<hr />
<h2>5. 功能全景</h2>
<h3>5.1 多模态（视觉 + 视频）</h3>
<ul>
<li>原生图片理解：STEM 图表、文档、截图、照片</li>
<li>视频理解：最长小时级视频</li>
<li>视觉网页开发（Vision2Web）、视觉数学（MathVision）、科学图表（CharXiv）</li>
</ul>
<h3>5.2 灵活思考控制（Flexible Thinking）</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>能力</th>
<th>说明</th>
</tr>
</thead>
<tbody>
<tr>
<td>默认思考</td>
<td>思考模式默认开启</td>
</tr>
<tr>
<td>按需关闭</td>
<td>每次请求可关闭（<code>enable_thinking=False</code>）</td>
</tr>
<tr>
<td>深度可调</td>
<td><code>reasoning_effort</code> 调节推理深度</td>
</tr>
<tr>
<td>历史保留</td>
<td><code>preserve_thinking</code> 保留历史思考上下文</td>
</tr>
</tbody>
</table>
<h3>5.3 Agent（智能体）能力</h3>
<ul>
<li>自主规划、环境反馈处理</li>
<li>电脑操作（OSWorld）、浏览器操作（WebArena）、手机操作（AndroidWorld）</li>
<li>工具调用（多模态工具调用 ClawEval-MM）</li>
</ul>
<h3>5.4 编码能力</h3>
<ul>
<li>终端编码（Terminal Bench）、仓库级代码生成（NL2Repo-Bench）、软件工程（SWE-bench Pro、DeepSWE、QwenSWEBench）</li>
</ul>
<hr />
<h2>6. 官方基准成绩</h2>
<p dir="auto">以下为 Qwen3.8-27B 官方模型卡公布的**基座模型（BF16）**成绩（节选强项）：</p>
<h3>Agent 与操作</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>基准</th>
<th>能力</th>
<th>成绩</th>
</tr>
</thead>
<tbody>
<tr>
<td>OSWorld-Verified</td>
<td>电脑操作</td>
<td><strong>84.3</strong></td>
</tr>
<tr>
<td>AndroidWorld</td>
<td>手机操作</td>
<td><strong>81.9</strong></td>
</tr>
<tr>
<td>WebArena-Verified</td>
<td>浏览器操作</td>
<td><strong>64.8</strong></td>
</tr>
<tr>
<td>RecreationBench</td>
<td>应用复刻</td>
<td><strong>47.1</strong></td>
</tr>
</tbody>
</table>
<h3>多模态</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>基准</th>
<th>能力</th>
<th>成绩</th>
</tr>
</thead>
<tbody>
<tr>
<td>MathVision</td>
<td>视觉数学（With CI）</td>
<td><strong>94.6</strong></td>
</tr>
<tr>
<td>CharXiv</td>
<td>科学图表分析（With CI）</td>
<td><strong>90.2</strong></td>
</tr>
<tr>
<td>BabyVision</td>
<td>通用视觉推理（With CI）</td>
<td><strong>85.6</strong></td>
</tr>
<tr>
<td>Vision2Web</td>
<td>视觉网页开发</td>
<td><strong>62.9</strong></td>
</tr>
<tr>
<td>ClawEval-MM</td>
<td>多模态工具调用</td>
<td><strong>57.4</strong></td>
</tr>
</tbody>
</table>
<h3>编码 / Agent 编码</h3>
<p dir="auto">覆盖 Terminal Bench 2.1、SWE-bench Pro、NL2Repo-Bench、DeepSWE 1.1、QwenSWEBench、LiveCodeBench v6（成绩见模型卡）。</p>
<h3>量化版恢复率（AMD 官方 GSM8K 5-shot）</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>模式</th>
<th>MXFP4（AWQ）</th>
<th>BF16 基座</th>
<th>恢复率</th>
</tr>
</thead>
<tbody>
<tr>
<td>思考模式</td>
<td>94.996% / 95.30%</td>
<td>93.33%</td>
<td><strong>101.8%</strong></td>
</tr>
<tr>
<td>无思考</td>
<td>89.92% / 89.76%</td>
<td>90.67%</td>
<td><strong>99.2%</strong></td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto">恢复率 &gt;100% 说明 MXFP4 在 GSM8K 上甚至略高于 BF16 基座（量化带来的轻微正则化效应）。这证明 AMD 的 MXFP4 量化<strong>几乎无损</strong>。</p>
</blockquote>
<hr />
<h2>7. 真实性能实测（本机 R9700）</h2>
<p dir="auto">以下为本机（AMD R9700 单卡 + vLLM + 投机解码）对 <strong>AutoRound INT4</strong> 版的实测：</p>
<h3>7.1 速度</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>场景</th>
<th>速度</th>
</tr>
</thead>
<tbody>
<tr>
<td>无思考（enable_thinking=false）</td>
<td>34.4 tok/s</td>
</tr>
<tr>
<td>含思考链</td>
<td>52.4~61 tok/s</td>
</tr>
<tr>
<td>投机解码提速</td>
<td>相对基线 +31%</td>
</tr>
</tbody>
</table>
<h3>7.2 四类日常任务实测</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>任务</th>
<th>速度</th>
<th>结果</th>
</tr>
</thead>
<tbody>
<tr>
<td>中文写作（会议通知）</td>
<td>36.9 tok/s</td>
<td>格式规范、要点完整</td>
</tr>
<tr>
<td>数学推理（进水出水题）</td>
<td>54.8 tok/s</td>
<td><strong>答案正确（2 小时）</strong>，含分步推导</td>
</tr>
<tr>
<td>代码生成（回文判断）</td>
<td>60.9 tok/s</td>
<td>函数+注释+示例，可运行</td>
</tr>
<tr>
<td>中译英</td>
<td>41.4 tok/s</td>
<td>翻译准确地道</td>
</tr>
</tbody>
</table>
<h3>7.3 多模态实测</h3>
<ul>
<li>发一张「左上红、右上绿、下半蓝」的测试图 → 模型正确回答颜色与分布，用时 0.9 秒</li>
</ul>
<h3>7.4 资源占用</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>指标</th>
<th>值</th>
</tr>
</thead>
<tbody>
<tr>
<td>显存占用</td>
<td>17.93 GiB（VRAM 88%）</td>
</tr>
<tr>
<td>前缀缓存命中率</td>
<td>84.8%（内部指标）</td>
</tr>
<tr>
<td>上下文</td>
<td>128K</td>
</tr>
</tbody>
</table>
<hr />
<h2>8. 日常学习办公场景评估</h2>
<h3>场景逐个评估（基于实测 + 官方基准）</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>日常场景</th>
<th>表现</th>
<th>评级</th>
</tr>
</thead>
<tbody>
<tr>
<td>中文写作/公文</td>
<td>格式规范、语气得体</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>中英互译</td>
<td>准确地道</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>数学/理科题</td>
<td>分步推理、答案正确</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>代码编写/调试</td>
<td>规范、可运行、带注释</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>文档总结/改写</td>
<td>良好（256K 长上下文支持长文档）</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>图片/截图理解</td>
<td>原生多模态，正确识别</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>表格/图表分析</td>
<td>CharXiv 90.2，强项</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>长文档/长视频理解</td>
<td>原生支持小时级视频</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>日常闲聊</td>
<td>可用，但非主打</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
</tbody>
</table>
<p dir="auto"><strong>小结</strong>：对学习办公来说，这个模型是"全能型"——写作、翻译、数学、代码、读图、读文档样样都强。唯一"短板"是：它设计上偏"Agent/编码"，日常闲聊的"人味"不如专门的对话模型，但这不影响办公使用。</p>
<hr />
<h2>9. 最主要应用场景</h2>
<p dir="auto">结合架构（GDN 长上下文）、官方定位和基准成绩，Qwen3.8-27B 的<strong>最主要应用场景</strong>按优先级排序：</p>
<h3>1. 本地 AI 智能体（Agent）—— 第一场景</h3>
<ul>
<li>官方明确主推（配合 AMD OpenClaw）</li>
<li>OSWorld 84.3 / AndroidWorld 81.9 / WebArena 64.8，操作类能力顶级</li>
<li>长程任务规划 + 环境反馈 + 工具调用</li>
<li><strong>典型用途</strong>：本地自动化助手（操作电脑、浏览器、手机），如 OpenClaw 智能体</li>
</ul>
<h3>2. 软件工程 / 编码 —— 第二场景</h3>
<ul>
<li>SWE-bench Pro、Terminal Bench、NL2Repo-Bench 全覆盖</li>
<li><strong>典型用途</strong>：本地编程助手、代码审查、自动化修 Bug（DSH 就是典型）</li>
</ul>
<h3>3. 多模态办公 / 研究 —— 第三场景</h3>
<ul>
<li>读图、读文档、读图表、读视频</li>
<li>MathVision 94.6、CharXiv 90.2</li>
<li><strong>典型用途</strong>：文档理解、图表分析、视觉数学题、截图问答</li>
</ul>
<h3>4. 日常学习办公 —— 顺带强项</h3>
<ul>
<li>写作、翻译、总结、数学、代码（本机实测全通过）</li>
</ul>
<hr />
<h2>10. 两个版本怎么选</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>你的情况</th>
<th>推荐</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>想要省心、开箱即用</strong></td>
<td><strong>AutoRound INT4</strong>（已部署跑通，质量略优，MTP 头无 bug）</td>
</tr>
<tr>
<td><strong>想要最小体积（14GB）</strong></td>
<td>AMD MXFP4（但需先处理 MTP 头 bug）</td>
</tr>
<tr>
<td><strong>追求极限质量</strong></td>
<td>两者接近无损，差异可忽略；社区实测 AutoRound 略优</td>
</tr>
<tr>
<td><strong>单卡 32GB 部署</strong></td>
<td>两个都能装下（18GB / 14GB），AutoRound 更省心</td>
</tr>
</tbody>
</table>
<p dir="auto"><strong>本机结论</strong>：我们已在 R9700 上跑通了 <strong>AutoRound INT4</strong>，速度 34~61 tok/s，质量优秀，数学/代码/翻译/读图全过。<strong>维持现状即可，无需换 MXFP4</strong>——MXFP4 省的那 4GB 对 32GB 卡意义不大，却要额外踩 MTP 头的坑。</p>
<hr />
<h2>11. 总结</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>维度</th>
<th>结论</th>
</tr>
</thead>
<tbody>
<tr>
<td>模型定位</td>
<td>27B 原生多模态 + GDN 长上下文 + 强 Agent/编码</td>
</tr>
<tr>
<td>量化质量</td>
<td>两个版本都接近无损（99%~102% 恢复率）</td>
</tr>
<tr>
<td>实测速度</td>
<td>34~61 tok/s（单卡 R9700 + 投机解码）</td>
</tr>
<tr>
<td>实测准确度</td>
<td>数学 代码 翻译 写作 读图</td>
</tr>
<tr>
<td>最主要场景</td>
<td><strong>AI 智能体 + 编码 + 多模态办公</strong></td>
</tr>
<tr>
<td>推荐选择</td>
<td><strong>AutoRound INT4</strong>（省心、质量略优、已部署）</td>
</tr>
</tbody>
</table>
<p dir="auto"><strong>总结</strong>：Qwen3.8-27B 是一个"为 Agent 和编码而生、顺带把学习办公全包"的全能型 27B 多模态模型；两个量化版质量几乎无损，选 AutoRound INT4 最省心。</p>
<hr />
<h2>附：参考资料</h2>
<ul>
<li><a href="https://huggingface.co/Qwen/Qwen3.8-27B" rel="nofollow ugc">Qwen/Qwen3.8-27B 模型卡</a></li>
<li><a href="https://huggingface.co/amd/Qwen3.8-27B-Quark-AWQ-MXFP4" rel="nofollow ugc">amd/Qwen3.8-27B-Quark-AWQ-MXFP4 模型卡</a></li>
<li><a href="https://huggingface.co/devan-carlin/Qwen3.8-27B-int4-AutoRound" rel="nofollow ugc">devan-carlin/Qwen3.8-27B-int4-AutoRound 模型卡</a></li>
<li><a href="https://github.com/zzpanic/qwen3.6-vllm-gfx1201-launchers" rel="nofollow ugc">zzpanic/qwen3.6-vllm-gfx1201-launchers（R9700 实测与内核补丁）</a></li>
<li><a href="https://www.amd.com/zh-cn/blogs/2026/run-qwen-3-8-27b-on-amd-ryzen-ai-max-and-radeon-graphics-cards-day-0.html" rel="nofollow ugc">AMD Day-0 支持 Qwen 3.8 官方博客</a></li>
</ul>
]]></description><link>https://lcz.me/topic/1756</link><generator>RSS for Node</generator><lastBuildDate>Fri, 25 Sep 2026 22:14:51 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1756.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 16 Sep 2026 13:09:53 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to AMD 官方 MXFP4与社区 INT4，两个量化版本深度评测 on Sat, 19 Sep 2026 01:45:10 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/jatwu" aria-label="Profile: jatwu">@<bdi>jatwu</bdi></a> 你好，本人小白。请详细解说此模型能带来什么实际功效？优缺点都有啥？由于我已投入家庭使用不方便测试，谢谢指教。</p>
]]></description><link>https://lcz.me/post/19258</link><guid isPermaLink="true">https://lcz.me/post/19258</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Sat, 19 Sep 2026 01:45:10 GMT</pubDate></item><item><title><![CDATA[Reply to AMD 官方 MXFP4与社区 INT4，两个量化版本深度评测 on Fri, 18 Sep 2026 16:08:24 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/magic629" aria-label="Profile: Magic629">@<bdi>Magic629</bdi></a> Radiance 用独立草稿模型 Qwen3.8-27B-DFlash2-FP8（--speculative-config 里显式指定），根本不碰 checkpoint 内置的 MTP 头，你可以试试。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项</th>
<th>值</th>
</tr>
</thead>
<tbody>
<tr>
<td>基座</td>
<td>Qwen3.8-27B-Quark-AWQ-MXFP4（served name Qwen3.8-27B-MXFP4）</td>
</tr>
<tr>
<td>草稿模型</td>
<td>Qwen3.8-27B-DFlash2-FP8（dflash 投机解码，7 token）</td>
</tr>
<tr>
<td>镜像 / 卡</td>
<td>magiccodingman/vllm-radiance:1.0.15，单卡 R9700#2（ROCR_VISIBLE_DEVICES=1，TP=1）</td>
</tr>
<tr>
<td>上下文 / 并发</td>
<td>--max-model-len 190000，--max-num-seqs 4</td>
</tr>
<tr>
<td>KV</td>
<td>--kv-cache-dtype fp8，--kv-cache-memory-bytes 8912057139（8.3GB 写死），utilization 0.98</td>
</tr>
<tr>
<td>预填块</td>
<td>--max-num-batched-tokens 4096（09-16 OOM 事故后从 8192 压下来的修复值）</td>
</tr>
<tr>
<td>注意力</td>
<td>R4D + prefix caching + --no-async-scheduling，PIECEWISE cudagraph</td>
</tr>
<tr>
<td>采样默认</td>
<td>temperature 0.7 / top_p 0.95 / top_k 20 / repetition_penalty 1.05（修编程死循环）</td>
</tr>
<tr>
<td>能力开关</td>
<td>--language-model-only（不能看图，带图请求自动转 node2）；tools qwen3_xml、reasoning qwen3</td>
</tr>
<tr>
<td>附加</td>
<td>ROCR 1.18 rel-7.2 预加载（修 CPU 空转 84°C）；radiance-watchdog.timer 每分钟探活；</td>
</tr>
</tbody>
</table>
]]></description><link>https://lcz.me/post/19200</link><guid isPermaLink="true">https://lcz.me/post/19200</guid><dc:creator><![CDATA[jatwu]]></dc:creator><pubDate>Fri, 18 Sep 2026 16:08:24 GMT</pubDate></item><item><title><![CDATA[Reply to AMD 官方 MXFP4与社区 INT4，两个量化版本深度评测 on Wed, 16 Sep 2026 13:19:14 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 是的，我实测干活可以，但任务一复杂就有点力不从心了。</p>
]]></description><link>https://lcz.me/post/18640</link><guid isPermaLink="true">https://lcz.me/post/18640</guid><dc:creator><![CDATA[Magic629]]></dc:creator><pubDate>Wed, 16 Sep 2026 13:19:14 GMT</pubDate></item><item><title><![CDATA[Reply to AMD 官方 MXFP4与社区 INT4，两个量化版本深度评测 on Wed, 16 Sep 2026 13:17:58 GMT]]></title><description><![CDATA[<p dir="auto">Qwen 27B在短任务中还是相当能打的，长链还是远不如Deepseek，这个事模型尺寸有一定的影响，更重要的是长上下文找回准确率不够导致的 ，这个是硬伤，技术突破的难度很大。</p>
]]></description><link>https://lcz.me/post/18639</link><guid isPermaLink="true">https://lcz.me/post/18639</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 16 Sep 2026 13:17:58 GMT</pubDate></item></channel></rss>