<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[15 年老平台 + 单张 RX 7900 XTX 跑 Qwen3.8-27B：本地 Coding Agent 实测]]></title><description><![CDATA[<h2>先说结论</h2>
<p dir="auto">我原本只是想验证一件事：</p>
<p dir="auto">一台十多年前的旧电脑，如果只升级显卡，能不能变成一台真正可用的本地 Coding Agent Server？</p>
<p dir="auto">实际测试下来，答案是：可以。</p>
<p dir="auto">我的平台是非常老的 Intel Sandy Bridge 平台，只有 16GB DDR3，没有 ReBAR，CPU 也只是 i5-2400。</p>
<p dir="auto">唯一真正有算力的硬件，是一张：</p>
<p dir="auto"><strong>AMD Radeon RX 7900 XTX 24GB</strong></p>
<p dir="auto">目前我最终使用的组合是：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>配置</th>
</tr>
</thead>
<tbody>
<tr>
<td>模型</td>
<td>Qwen3.8-27B</td>
</tr>
<tr>
<td>量化</td>
<td>Q4_K_M GGUF</td>
</tr>
<tr>
<td>Backend</td>
<td>llama.cpp</td>
</tr>
<tr>
<td>GPU Backend</td>
<td>Vulkan / Mesa RADV</td>
</tr>
<tr>
<td>MTP</td>
<td>MTP5</td>
</tr>
<tr>
<td>Context</td>
<td>98K</td>
</tr>
<tr>
<td>KV Cache</td>
<td>K=q8_0 / V=q4_1</td>
</tr>
<tr>
<td>Parallel</td>
<td>1</td>
</tr>
<tr>
<td>Prompt Cache</td>
<td>开启</td>
</tr>
<tr>
<td>Reasoning</td>
<td>关闭</td>
</tr>
<tr>
<td>Client</td>
<td>VS Code Agent</td>
</tr>
<tr>
<td>API</td>
<td>OpenAI-compatible API</td>
</tr>
</tbody>
</table>
<p dir="auto">在真实 Coding Agent 工作流里，实测大致可以做到：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th style="text-align:right">实测</th>
</tr>
</thead>
<tbody>
<tr>
<td>Decode</td>
<td style="text-align:right">约 40～46 tokens/s</td>
</tr>
<tr>
<td>长 Prompt Processing</td>
<td style="text-align:right">约 490～540 tokens/s</td>
</tr>
<tr>
<td>Context</td>
<td style="text-align:right">50K+ 可以正常工作</td>
</tr>
<tr>
<td>25 Steps Agent Task</td>
<td style="text-align:right">约 6 分钟</td>
</tr>
<tr>
<td>46 Steps Agent Task</td>
<td style="text-align:right">约 7 分 18 秒</td>
</tr>
</tbody>
</table>
<p dir="auto">而且这里说的不是单纯让模型“写一段代码”。</p>
<p dir="auto">我实际跑的是完整 Agent Loop：</p>
<blockquote>
<p dir="auto">读取项目 → 修改代码 → 执行命令 → 启动网页 → Browser / Playwright 测试 → 找问题 → 修改 → Retest → 完成任务</p>
</blockquote>
<p dir="auto">所以这次实验给我的最大结论其实不是“7900 XTX 能跑多少 token”。</p>
<p dir="auto">而是：</p>
<p dir="auto"><strong>对于可以主要放进显存的量化模型，旧 CPU、DDR3、老主板并不一定会让整台机器失去作为 Local AI Server 的价值。</strong></p>
<p dir="auto">如果手上本来已经有一台旧电脑，只想搭一台本地 Coding Agent Server，未必一定要先把整个平台全部换掉。</p>
<hr />
<h2>一、实验背景</h2>
<p dir="auto">这台机器并不是专门为了 AI 新装的。</p>
<p dir="auto">原来的硬件大概是：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>硬件</th>
<th>配置</th>
</tr>
</thead>
<tbody>
<tr>
<td>CPU</td>
<td>Intel Core i5-2400</td>
</tr>
<tr>
<td>CPU 规格</td>
<td>4 Core / 4 Thread</td>
</tr>
<tr>
<td>架构</td>
<td>Sandy Bridge</td>
</tr>
<tr>
<td>平台</td>
<td>B75</td>
</tr>
<tr>
<td>RAM</td>
<td>16GB DDR3</td>
</tr>
<tr>
<td>SSD</td>
<td>SATA SSD</td>
</tr>
<tr>
<td>系统</td>
<td>Ubuntu Server</td>
</tr>
<tr>
<td>GPU</td>
<td>RX 7900 XTX 24GB</td>
</tr>
</tbody>
</table>
<p dir="auto">因此这个实验的核心思路很简单：</p>
<p dir="auto"><strong>尽量不要让旧 CPU 参与模型计算，把主要推理工作留在 GPU VRAM。</strong></p>
<p dir="auto">换句话说，我并不是想证明 i5-2400 很适合跑 AI。</p>
<p dir="auto">真正想测试的是：</p>
<p dir="auto"><strong>当模型主要在 GPU 上运行时，Host 平台到底可以旧到什么程度？</strong></p>
<hr />
<h2>二、我的主要用途：Coding Agent，而不是聊天</h2>
<p dir="auto">这台 Server 主要不是拿来聊天。</p>
<p dir="auto">我的目标是让它成为一台：</p>
<p dir="auto"><strong>Local Coding Agent Server</strong></p>
<p dir="auto">Client 主要使用 VS Code Agent，通过 OpenAI-compatible Chat Completions API 连接本地模型。</p>
<p dir="auto">Agent 会实际执行：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>Agent Workflow</th>
</tr>
</thead>
<tbody>
<tr>
<td>Read repository</td>
</tr>
<tr>
<td>Edit files</td>
</tr>
<tr>
<td>Terminal command</td>
</tr>
<tr>
<td>Browser automation</td>
</tr>
<tr>
<td>Playwright</td>
</tr>
<tr>
<td>Debug</td>
</tr>
<tr>
<td>Retest</td>
</tr>
<tr>
<td>Subagent review</td>
</tr>
</tbody>
</table>
<p dir="auto">因此我比较关心的并不是单轮 Benchmark，而是：</p>
<p dir="auto"><strong>长 Context、多轮 Tool Calling、Prompt Cache、Agent Loop 和真实任务完成时间。</strong></p>
<p dir="auto">这也是为什么下面很多数据，和普通“问一句问题然后看 token/s”的 Benchmark 会有一点不同。</p>
<hr />
<h2>三、最终比较满意的配置</h2>
<p dir="auto">目前我实际长期使用的大致配置如下。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>配置</th>
</tr>
</thead>
<tbody>
<tr>
<td>模型</td>
<td>Qwen3.8-27B Q4_K_M</td>
</tr>
<tr>
<td>GGUF 大小</td>
<td>大约 17～18GB</td>
</tr>
<tr>
<td>Backend</td>
<td>llama.cpp</td>
</tr>
<tr>
<td>GPU Backend</td>
<td>Vulkan / Mesa RADV</td>
</tr>
<tr>
<td>Context</td>
<td>98,304 tokens</td>
</tr>
<tr>
<td>Parallel</td>
<td>1</td>
</tr>
<tr>
<td>KV Cache K</td>
<td>q8_0</td>
</tr>
<tr>
<td>KV Cache V</td>
<td>q4_1</td>
</tr>
<tr>
<td>MTP</td>
<td>MTP5</td>
</tr>
<tr>
<td>Prompt Cache</td>
<td>开启</td>
</tr>
<tr>
<td>Reasoning</td>
<td>OFF</td>
</tr>
</tbody>
</table>
<p dir="auto">这里有一个很重要的前提：</p>
<p dir="auto"><strong>必须使用保留 MTP / NextN layers 的 GGUF。</strong></p>
<p dir="auto">不是所有同名 Q4_K_M GGUF 都可以直接开启 MTP。</p>
<p dir="auto">因为 Host 平台太旧，我最后没有继续花时间折腾 ROCm Host compatibility。</p>
<p dir="auto">对这台机器而言，Vulkan 方案已经足够稳定。</p>
<p dir="auto">实际 Agent Session 已经跑到：</p>
<p dir="auto"><strong>55,899 tokens</strong></p>
<p dir="auto">而没有发生 truncation。</p>
<p dir="auto">这也让我改变了一个原本的看法：</p>
<p dir="auto">以前觉得 64K Context 已经很大。</p>
<p dir="auto">实际跑 Coding Agent 后，会发现：</p>
<p dir="auto"><strong>64K 并没有想象中那么宽裕。</strong></p>
<p dir="auto">因为除了聊天内容之外，还有：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>Context 内容</th>
</tr>
</thead>
<tbody>
<tr>
<td>System Prompt</td>
</tr>
<tr>
<td>Tool Schema</td>
</tr>
<tr>
<td>Agent History</td>
</tr>
<tr>
<td>File Context</td>
</tr>
<tr>
<td>Tool Results</td>
</tr>
</tbody>
</table>
<p dir="auto">这些东西增长得很快。</p>
<hr />
<h2>四、KV Cache：目前使用 K8 / V4.1</h2>
<p dir="auto">我最开始为了尽量省显存，使用过：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>阶段</th>
<th>K</th>
<th>V</th>
</tr>
</thead>
<tbody>
<tr>
<td>最初</td>
<td>q4_0</td>
<td>q4_0</td>
</tr>
<tr>
<td>目前</td>
<td>q8_0</td>
<td>q4_1</td>
</tr>
</tbody>
</table>
<p dir="auto">也就是我现在使用的：</p>
<p dir="auto"><strong>K8 / V4.1</strong></p>
<p dir="auto">原因很简单。</p>
<p dir="auto">24GB VRAM 不只是存模型，还要同时容纳：</p>
<p dir="auto"><strong>Model + KV Cache + MTP + llama.cpp Buffers + Long Context</strong></p>
<p dir="auto">因此我没有把 K/V 两边都开得很高。</p>
<p dir="auto">目前对我的 Workload 来说：</p>
<p dir="auto"><strong>K8 / V4.1 是比较实际的平衡点。</strong></p>
<hr />
<h2>五、MTP5 的实际收益</h2>
<p dir="auto">我一开始使用的是 MTP2，后来改成 MTP5。</p>
<p dir="auto">实际结果：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>MTP</th>
<th style="text-align:right">Decode</th>
<th style="text-align:right">Acceptance</th>
<th style="text-align:right">Mean Accepted Length</th>
</tr>
</thead>
<tbody>
<tr>
<td>MTP2</td>
<td style="text-align:right">约 39～40 t/s</td>
<td style="text-align:right">约 71%</td>
<td style="text-align:right">约 2.4</td>
</tr>
<tr>
<td>MTP5</td>
<td style="text-align:right">约 44～46 t/s</td>
<td style="text-align:right">约 64～69%</td>
<td style="text-align:right">约 4.2～4.5</td>
</tr>
</tbody>
</table>
<p dir="auto">MTP5 其中两次 Agent Request：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:right">Prompt</th>
<th style="text-align:right">Prompt Processing</th>
<th style="text-align:right">Decode</th>
<th style="text-align:right">Acceptance</th>
<th style="text-align:right">Mean Accepted Length</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:right">20,149 tokens</td>
<td style="text-align:right">489.70 t/s</td>
<td style="text-align:right">44.26 t/s</td>
<td style="text-align:right">64.30%</td>
<td style="text-align:right">4.21</td>
</tr>
<tr>
<td style="text-align:right">45,222 tokens</td>
<td style="text-align:right">538.98 t/s</td>
<td style="text-align:right">44.49 t/s</td>
<td style="text-align:right">69.41%</td>
<td style="text-align:right">4.47</td>
</tr>
</tbody>
</table>
<p dir="auto">实际生成过程中经常看到：</p>
<p dir="auto"><strong>43～46 t/s</strong></p>
<p dir="auto">所以在我的机器上，大致可以理解成：</p>
<p dir="auto"><strong>MTP2：约 39～40 t/s</strong></p>
<p dir="auto"><strong>MTP5：约 44～46 t/s</strong></p>
<hr />
<h2>六、MTP 不能只看 Acceptance %</h2>
<p dir="auto">这个也是我实际跑过以后才觉得比较有意思的地方。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th></th>
<th style="text-align:right">MTP2</th>
<th style="text-align:right">MTP5</th>
</tr>
</thead>
<tbody>
<tr>
<td>Acceptance</td>
<td style="text-align:right">约 71%</td>
<td style="text-align:right">约 64～69%</td>
</tr>
<tr>
<td>Mean Accepted Length</td>
<td style="text-align:right">约 2.4</td>
<td style="text-align:right">约 4.2～4.5</td>
</tr>
<tr>
<td>Decode</td>
<td style="text-align:right">约 39～40 t/s</td>
<td style="text-align:right">约 44～46 t/s</td>
</tr>
</tbody>
</table>
<p dir="auto">只看 Acceptance：</p>
<p dir="auto"><strong>71% 比 64% 高</strong></p>
<p dir="auto">很容易觉得 MTP2 比较好。</p>
<p dir="auto">但实际 Decode Speed 反而是 MTP5 更快。</p>
<p dir="auto">所以我现在看 MTP，不会只盯着 Acceptance Rate。</p>
<p dir="auto">至少要一起看：</p>
<p dir="auto"><strong>Acceptance % + Mean Accepted Length + Decode tokens/s + 最终任务时间</strong></p>
<p dir="auto">最终还是以真实 Workload 为准。</p>
<hr />
<h2>七、两次真实 Agent Task</h2>
<p dir="auto">两次比较完整的测试：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>测试</th>
<th style="text-align:right">Steps</th>
<th style="text-align:right">时间</th>
</tr>
</thead>
<tbody>
<tr>
<td>Test 1</td>
<td style="text-align:right">25 Steps</td>
<td style="text-align:right">约 6 分钟</td>
</tr>
<tr>
<td>Test 2</td>
<td style="text-align:right">46 Steps</td>
<td style="text-align:right">7 分 18 秒</td>
</tr>
</tbody>
</table>
<h3>25 Steps / 6 分钟</h3>
<p dir="auto">Agent 自己完成：</p>
<p dir="auto">写 HTML、写 CSS、写 JavaScript、启动本地 Server、打开 Browser、Playwright Test、Search Test、Filter Test、Add Issue、Validation、Close / Reopen、Delete、LocalStorage、Reset、Mobile 375px Test、Desktop Layout Check、找 UI 问题、修改 CSS、Retest、检查 Console Error。</p>
<p dir="auto">整个过程没有人工接手。</p>
<h3>46 Steps / 7 分 18 秒</h3>
<p dir="auto">这一次包括：</p>
<p dir="auto">Main Agent、Responsive Review Subagent、Browser Automation、Mobile Test、Desktop Test、Console Test、CSS Fix、Retest。</p>
<p dir="auto">Subagent 还额外发现了几个 UI 问题，例如：</p>
<ul>
<li>Mobile Toolbar 有异常空白</li>
<li>Touch Target 太小</li>
<li>Narrow Screen Badge Wrapping 不理想</li>
</ul>
<p dir="auto">Main Agent 再根据 Review 修改 CSS，然后重新测试。</p>
<p dir="auto">最终验证：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>结果</th>
</tr>
</thead>
<tbody>
<tr>
<td>375px</td>
<td>无 Horizontal Scroll</td>
</tr>
<tr>
<td>Buttons</td>
<td>≥ 44px</td>
</tr>
<tr>
<td>Mobile Stat Cards</td>
<td>2 Columns</td>
</tr>
<tr>
<td>Desktop</td>
<td>4 Columns</td>
</tr>
<tr>
<td>Console</td>
<td>0 Errors</td>
</tr>
</tbody>
</table>
<p dir="auto">如果单纯拿 Steps 去除时间：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>测试</th>
<th style="text-align:right">平均时间</th>
</tr>
</thead>
<tbody>
<tr>
<td>25 Steps / 360 秒</td>
<td style="text-align:right">≈ 14.4 秒 / Step</td>
</tr>
<tr>
<td>46 Steps / 438 秒</td>
<td style="text-align:right">≈ 9.5 秒 / Step</td>
</tr>
</tbody>
</table>
<p dir="auto">当然 Agent Step 本身并不是完全相同的工作量，所以这个数字不能当正式 Benchmark。</p>
<p dir="auto">不过它至少说明一件事：</p>
<p dir="auto"><strong>真实 Agent 工作流的总时间，不是单纯由 Output Token Speed 决定。</strong></p>
<hr />
<h2>八、一次 56K Context 的实际 Session</h2>
<p dir="auto">其中一个比较长的 Agent Session，结束时数据是：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>指标</th>
<th style="text-align:right">数据</th>
</tr>
</thead>
<tbody>
<tr>
<td>Final Context</td>
<td style="text-align:right">55,899 tokens</td>
</tr>
<tr>
<td>Truncated</td>
<td style="text-align:right">0</td>
</tr>
<tr>
<td>Decode</td>
<td style="text-align:right">40.84 t/s</td>
</tr>
<tr>
<td>Generated</td>
<td style="text-align:right">720 tokens</td>
</tr>
<tr>
<td>MTP Acceptance</td>
<td style="text-align:right">64.327%</td>
</tr>
<tr>
<td>Accepted</td>
<td style="text-align:right">550</td>
</tr>
<tr>
<td>Draft Generated</td>
<td style="text-align:right">855</td>
</tr>
<tr>
<td>Mean Accepted Length</td>
<td style="text-align:right">4.22</td>
</tr>
</tbody>
</table>
<p dir="auto">生成过程中我看到过：</p>
<p dir="auto"><strong>44.59 t/s、44.61 t/s、43.52 t/s、42.83 t/s</strong></p>
<p dir="auto">所以在我的使用方式里：</p>
<p dir="auto"><strong>40～46 t/s 是一个比较接近真实 Coding Workload 的范围。</strong></p>
<hr />
<h2>九、长 Context 下，真正慢的可能不是 Decode</h2>
<p dir="auto">这是这次实验里我觉得很值得分享的一点。</p>
<p dir="auto">其中一次 Request：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>阶段</th>
<th style="text-align:right">Tokens</th>
<th style="text-align:right">性能</th>
<th style="text-align:right">耗时</th>
</tr>
</thead>
<tbody>
<tr>
<td>Prefill</td>
<td style="text-align:right">45,222 tokens</td>
<td style="text-align:right">538.98 tokens/s</td>
<td style="text-align:right">约 84 秒</td>
</tr>
<tr>
<td>Decode</td>
<td style="text-align:right">455 tokens</td>
<td style="text-align:right">44.49 tokens/s</td>
<td style="text-align:right">约 10 秒</td>
</tr>
</tbody>
</table>
<p dir="auto">也就是说这一轮 Request 大概是：</p>
<p dir="auto"><strong>84 秒 Prefill vs 10 秒 Decode</strong></p>
<p dir="auto">所以 Coding Agent 到了 40K～50K Context 以后：</p>
<p dir="auto"><strong>真正的等待时间很可能主要来自 Prompt Processing，而不是 Output Token Speed。</strong></p>
<p dir="auto">这也是为什么我后来没有只追求把 Decode 从 40 t/s 调到 45 t/s。</p>
<p dir="auto">因为如果每一轮都要重新 Prefill 50K Token，</p>
<p dir="auto">那多出来的几 t/s，其实不是最大的性能差异。</p>
<hr />
<h2>十、Prompt Cache 对 Coding Agent 非常重要</h2>
<p dir="auto">多轮 Coding Agent 的请求，经常会和上一轮共享大量 Prefix。</p>
<p dir="auto">例如：</p>
<p dir="auto"><strong>System Prompt + Tool Schema + Conversation History + Project Context</strong></p>
<p dir="auto">我实际在 Log 里面看过：</p>
<p dir="auto"><strong>LCP Similarity = 0.999</strong></p>
<p dir="auto">在一个已经很长的 Conversation 里，下一轮如果 Prefix Cache 命中，</p>
<p dir="auto">实际可能只需要重新 Evaluate：</p>
<p dir="auto"><strong>二十多个新 Tokens</strong></p>
<p dir="auto">这种情况下，Agent 的体感和重新 Prefill 几十 K Token 完全是两回事。</p>
<p dir="auto">所以对我来说：</p>
<p dir="auto"><strong>Prompt Cache 是 Coding Agent 配置里非常重要的一部分。</strong></p>
<hr />
<h2>十一、16GB RAM 反而是这台机器最需要注意的地方</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th style="text-align:right">数据</th>
</tr>
</thead>
<tbody>
<tr>
<td>GPU VRAM</td>
<td style="text-align:right">24GB</td>
</tr>
<tr>
<td>Host RAM</td>
<td style="text-align:right">16GB DDR3</td>
</tr>
<tr>
<td>Host Memory Peak</td>
<td style="text-align:right">13GB+</td>
</tr>
<tr>
<td>Host Prompt Cache</td>
<td style="text-align:right">1GB</td>
</tr>
</tbody>
</table>
<p dir="auto">实际运行时，也曾经出现少量 Swap。</p>
<p dir="auto">老机器一旦开始 Swap，整个 Ubuntu 的响应会明显变差。</p>
<p dir="auto">因此我没有照搬一些 64GB / 128GB RAM Server 的配置。</p>
<p dir="auto">对这台机器来说：</p>
<p dir="auto"><strong>稳定性比多一点 Host Cache 更重要。</strong></p>
<hr />
<h2>十二、我给模型进程加了 RAM 保护</h2>
<p dir="auto">因为只有 16GB RAM，我还给模型进程加了 Memory Limit。</p>
<p dir="auto">大致逻辑类似：</p>
<pre><code class="language-text">MemoryHigh=12G
MemoryMax=14G
MemorySwapMax=0
OOMPolicy=stop
OOMScoreAdjust=500
Restart=on-failure
RestartSec=60
</code></pre>
<p dir="auto">这些设置不是为了提升性能。</p>
<p dir="auto">目的只有一个：</p>
<p dir="auto"><strong>宁愿模型服务失败，也不要因为 Swap 把整台 Server 一起拖死。</strong></p>
<p dir="auto">对旧机器尤其有用。</p>
<hr />
<h2>十三、没有 ReBAR 也可以跑</h2>
<p dir="auto">这台 B75 平台没有 Resizable BAR。</p>
<p dir="auto">在 Vulkan 环境下我另外使用了：</p>
<pre><code class="language-text">GGML_VK_DISABLE_HOST_VISIBLE_VIDMEM=1
</code></pre>
<p dir="auto">至少在我这台没有 ReBAR 的老平台上，目前运行稳定。</p>
<p dir="auto">因此：</p>
<p dir="auto"><strong>没有 ReBAR 并不代表 llama.cpp + Vulkan + 7900 XTX 就一定不能用。</strong></p>
<p dir="auto">它当然不是理想平台，但对于“把旧电脑重新利用起来”这种场景，仍然有实际价值。</p>
<hr />
<h2>十四、Parallel=1 不等于 Agent 不能使用 Subagent</h2>
<p dir="auto">我之前也测试过：</p>
<p dir="auto"><strong>Parallel=2</strong></p>
<p dir="auto">后来因为主要只有一个 Coding Agent 长时间工作，所以最终改成：</p>
<p dir="auto"><strong>Parallel=1</strong></p>
<p dir="auto">有意思的是：</p>
<p dir="auto">VS Code Agent 仍然可以启动：</p>
<p dir="auto"><strong>Main Agent + Subagent</strong></p>
<p dir="auto">原因是：</p>
<p dir="auto">Agent / Subagent 和 llama.cpp Parallel Slot 并不是同一个概念。</p>
<p dir="auto">Parallel=1 代表：</p>
<p dir="auto">同一时间只有一个 LLM inference slot。</p>
<p dir="auto">但 Harness 仍然可以管理多个 Agent Context。</p>
<p dir="auto">它们的模型请求可以排队使用同一个 Slot。</p>
<p dir="auto">而且像下面这些操作：</p>
<p dir="auto"><strong>Playwright、Browser、Terminal、Read File</strong></p>
<p dir="auto">本身也不等于 GPU 正在 Decode。</p>
<p dir="auto">所以实际使用中：</p>
<pre><code class="language-text">VS Code:
Main Agent + Subagent

llama.cpp:
Parallel = 1
</code></pre>
<p dir="auto">是可以正常工作的。</p>
<hr />
<h2>十五、Reasoning OFF 也能完成完整 Agent Workflow</h2>
<p dir="auto">目前我的配置是：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>配置</th>
</tr>
</thead>
<tbody>
<tr>
<td>Reasoning</td>
<td>OFF</td>
</tr>
<tr>
<td>Thinking</td>
<td>false</td>
</tr>
</tbody>
</table>
<p dir="auto">前面提到的：</p>
<ul>
<li>25 Steps / 6 分钟</li>
<li>46 Steps / 7 分 18 秒</li>
</ul>
<p dir="auto">都是在这个状态下完成。</p>
<p dir="auto">至少对于我的 Coding Workflow：</p>
<blockquote>
<p dir="auto">Read → Edit → Test → Browser → Debug → Retest</p>
</blockquote>
<p dir="auto">关闭 Explicit Reasoning 并不代表 Agent 就无法完成复杂任务。</p>
<p dir="auto">因为 Agent 本身已经形成了一个外部循环：</p>
<blockquote>
<p dir="auto">Tool → Result → Next Action</p>
</blockquote>
<p dir="auto">另外一个实际好处是：</p>
<p dir="auto">不会先生成很长一段 Thinking，然后才真正开始 Call Tool。</p>
<hr />
<h2>十六、一个真正让我卡了很久的坑：Qwen Tool Loop + Jinja</h2>
<p dir="auto">这个问题反而比 GPU 更麻烦。</p>
<p dir="auto">最开始的时候：</p>
<ul>
<li>普通 Chat 正常</li>
<li>第一轮 Tool Call 正常</li>
<li>Edit 正常</li>
</ul>
<p dir="auto">但 Agent 连续跑了一段时间之后，会突然出现：</p>
<p dir="auto"><strong>HTTP 500</strong></p>
<p dir="auto">Server Log 会看到类似：</p>
<pre><code class="language-text">Jinja Exception:
No user query found in messages.
</code></pre>
<p dir="auto">Coding Harness Retry 几次以后，整个 Workflow 就会失败。</p>
<p dir="auto">一开始我怀疑过很多东西：</p>
<p dir="auto"><strong>Context、MTP、GPU、Vulkan、VRAM</strong></p>
<p dir="auto">最后发现和这些都没有直接关系。</p>
<p dir="auto">真正的问题是：</p>
<p dir="auto"><strong>Qwen Chat Template + 多轮 Agent Tool History</strong></p>
<hr />
<h2>十七、换 Chat Template 后，Agent Loop 才真正稳定</h2>
<p dir="auto">后来我换用了针对 Qwen Agent / Tool Loop 修正过的 Chat Template，</p>
<p dir="auto">通过：</p>
<pre><code class="language-text">--jinja
--chat-template-file &lt;chat-template&gt;
</code></pre>
<p dir="auto">加载。</p>
<p dir="auto">之后同类型 Agent Workflow 可以连续跑几十个 Steps。</p>
<p dir="auto">之前经常出现的：</p>
<pre><code class="language-text">No user query found in messages
</code></pre>
<p dir="auto">基本消失。</p>
<p dir="auto">所以如果有人遇到这种情况：</p>
<p dir="auto"><strong>Qwen 普通聊天完全正常，但 llama.cpp 接 Coding Agent，跑多轮 Tool Calling 后突然 Jinja 500</strong></p>
<p dir="auto">我会建议优先检查：</p>
<p dir="auto"><strong>Chat Template</strong></p>
<p dir="auto">而不是先怀疑显卡或者 Context。</p>
<hr />
<h2>十八、另一个坑：同名 GGUF 不代表内容一样</h2>
<p dir="auto">我第一次下载 Qwen3.8-27B Q4_K_M GGUF 时：</p>
<ul>
<li>Chat 正常</li>
<li>Coding 正常</li>
<li>Tool Calling 正常</li>
</ul>
<p dir="auto">但一开：</p>
<pre><code class="language-text">--spec-type draft-mtp
</code></pre>
<p dir="auto">就报：</p>
<pre><code class="language-text">model doesn't contain MTP layers
</code></pre>
<p dir="auto">原因是那个 GGUF 并没有保留 MTP / NextN layers。</p>
<p dir="auto">后来换了一个明确支持 MTP 的 conversion 才正常。</p>
<p dir="auto">所以：</p>
<p dir="auto"><strong>Qwen 原始模型支持 MTP，不代表所有 Community GGUF 都支持 MTP。</strong></p>
<p dir="auto">即使文件名都叫：</p>
<p dir="auto"><strong>Qwen3.8-27B-Q4_K_M</strong></p>
<p dir="auto">不同：</p>
<p dir="auto"><strong>Repository、Converter、Conversion 时间、Export 方式</strong></p>
<p dir="auto">里面实际保留的 Tensor 都可能不同。</p>
<p dir="auto">所以不要只看文件名。</p>
<hr />
<h2>十九、目前的性能汇总</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>类别</th>
<th>项目</th>
<th>配置 / 实测</th>
</tr>
</thead>
<tbody>
<tr>
<td>硬件</td>
<td>CPU</td>
<td>Intel Core i5-2400</td>
</tr>
<tr>
<td>硬件</td>
<td>Platform</td>
<td>B75 / Sandy Bridge</td>
</tr>
<tr>
<td>硬件</td>
<td>RAM</td>
<td>16GB DDR3</td>
</tr>
<tr>
<td>硬件</td>
<td>GPU</td>
<td>AMD Radeon RX 7900 XTX 24GB</td>
</tr>
<tr>
<td>模型</td>
<td>Model</td>
<td>Qwen3.8-27B</td>
</tr>
<tr>
<td>模型</td>
<td>Quant</td>
<td>Q4_K_M</td>
</tr>
<tr>
<td>模型</td>
<td>GGUF</td>
<td>MTP-capable GGUF</td>
</tr>
<tr>
<td>Backend</td>
<td>Runtime</td>
<td>llama.cpp</td>
</tr>
<tr>
<td>Backend</td>
<td>GPU</td>
<td>Vulkan / RADV</td>
</tr>
<tr>
<td>配置</td>
<td>Parallel</td>
<td>1</td>
</tr>
<tr>
<td>配置</td>
<td>Context</td>
<td>98,304</td>
</tr>
<tr>
<td>配置</td>
<td>KV K</td>
<td>q8_0</td>
</tr>
<tr>
<td>配置</td>
<td>KV V</td>
<td>q4_1</td>
</tr>
<tr>
<td>配置</td>
<td>Batch</td>
<td>512</td>
</tr>
<tr>
<td>配置</td>
<td>uBatch</td>
<td>512</td>
</tr>
<tr>
<td>配置</td>
<td>Flash Attention</td>
<td>ON</td>
</tr>
<tr>
<td>配置</td>
<td>MTP</td>
<td>5</td>
</tr>
<tr>
<td>配置</td>
<td>Reasoning</td>
<td>OFF</td>
</tr>
<tr>
<td>配置</td>
<td>Prompt Cache</td>
<td>ON</td>
</tr>
<tr>
<td>性能</td>
<td>Decode</td>
<td>约 40～46 tokens/s</td>
</tr>
<tr>
<td>性能</td>
<td>Long Prompt Processing</td>
<td>约 490～540 tokens/s</td>
</tr>
<tr>
<td>MTP5</td>
<td>Acceptance</td>
<td>约 64～69%</td>
</tr>
<tr>
<td>MTP5</td>
<td>Mean Accepted Length</td>
<td>约 4.2～4.5</td>
</tr>
<tr>
<td>Session</td>
<td>Final Context</td>
<td>55,899 tokens</td>
</tr>
<tr>
<td>Session</td>
<td>Truncated</td>
<td>0</td>
</tr>
<tr>
<td>Workflow</td>
<td>25 Steps</td>
<td>约 6 分钟</td>
</tr>
<tr>
<td>Workflow</td>
<td>46 Steps</td>
<td>7 分 18 秒</td>
</tr>
</tbody>
</table>
<hr />
<h2>二十、这次实验最重要的几个发现</h2>
<p dir="auto">如果把整个实验浓缩成几条，我觉得最值得分享的是：</p>
<ol>
<li>
<p dir="auto"><strong>模型只要主要留在显存里，Host 平台可以比想象中旧很多。</strong></p>
<p dir="auto">我的 i5-2400 和 DDR3 并没有阻止 7900 XTX 把 27B Q4 模型跑到 40～46 t/s。</p>
</li>
<li>
<p dir="auto"><strong>Coding Agent 的瓶颈不能只看 Decode Speed。</strong></p>
<p dir="auto">Context 到 40K～50K 以后，Prefill 时间可能远远超过 Decode 时间。</p>
</li>
<li>
<p dir="auto"><strong>Prompt Cache 对 Agent 的价值非常高。</strong></p>
<p dir="auto">特别是 Tool Schema、System Prompt 和 Conversation History 很长的时候。</p>
</li>
<li>
<p dir="auto"><strong>MTP 是否有效，要看真实任务。</strong></p>
<p dir="auto">Acceptance Rate 高，不代表最终一定更快。</p>
</li>
<li>
<p dir="auto"><strong>GGUF 是否保留 MTP Layers 很重要。</strong></p>
<p dir="auto">同一个模型、同一个量化名称，不同 conversion 可能完全不同。</p>
</li>
<li>
<p dir="auto"><strong>Chat Template 对 Tool Calling 稳定性非常重要。</strong></p>
<p dir="auto">普通 Chat 能跑，并不代表多轮 Agent Tool Loop 一定能跑。</p>
</li>
<li>
<p dir="auto"><strong>16GB RAM 可以用，但已经非常接近下限。</strong></p>
<p dir="auto">这种配置里，RAM 稳定性反而比 CPU 性能更值得关注。</p>
</li>
</ol>
<hr />
<h2>二十一、最后的结论</h2>
<p dir="auto">这次实验原本只是想看看：</p>
<p dir="auto">一台十几年前的旧 PC，加一张现代 GPU，到底还能不能重新利用。</p>
<p dir="auto">实际结果比我预期好。</p>
<p dir="auto">目前这台机器已经不是只能跑一句 Prompt 的 Demo。</p>
<p dir="auto">它可以实际完成：</p>
<blockquote>
<p dir="auto">Build → Run → Browser → Playwright → Test → Find Problem → Edit → Retest → Finish</p>
</blockquote>
<p dir="auto">这样的完整 Coding Agent Workflow。</p>
<p dir="auto">所以如果手上本来已经有旧 PC，而需求主要是：</p>
<p dir="auto"><strong>单用户 / 少量用户的 Local LLM 或 Coding Agent Server</strong></p>
<p dir="auto">我觉得不一定要一开始就把：</p>
<p dir="auto"><strong>CPU、主板、RAM、SSD、GPU</strong></p>
<p dir="auto">全部换成新平台。</p>
<p dir="auto">只要模型大小和显存配置合适，</p>
<p dir="auto">先把预算集中到 GPU，旧 Host 继续使用，在某些场景下其实是完全可行的。</p>
<p dir="auto">至少 Qwen3.8-27B Q4 + RX 7900 XTX 24GB + llama.cpp Vulkan 这个组合，在我这里已经从“能跑”，走到了“真的可以拿来工作”。</p>
<hr />
<h2>附录：当前 llama.cpp 参数参考</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>参数</th>
<th>设置</th>
</tr>
</thead>
<tbody>
<tr>
<td>Backend</td>
<td>Vulkan</td>
</tr>
<tr>
<td>GPU Layers</td>
<td>all</td>
</tr>
<tr>
<td>Host Offload</td>
<td>尽量避免</td>
</tr>
<tr>
<td>Load Mode</td>
<td>mmap</td>
</tr>
<tr>
<td>Parallel</td>
<td>1</td>
</tr>
<tr>
<td>Context / Slot</td>
<td>98,304</td>
</tr>
<tr>
<td>KV Cache K</td>
<td>q8_0</td>
</tr>
<tr>
<td>KV Cache V</td>
<td>q4_1</td>
</tr>
<tr>
<td>Prompt Cache</td>
<td>ON</td>
</tr>
<tr>
<td>Host Prompt Cache</td>
<td>1024 MB</td>
</tr>
<tr>
<td>Batch</td>
<td>512</td>
</tr>
<tr>
<td>uBatch</td>
<td>512</td>
</tr>
<tr>
<td>Flash Attention</td>
<td>ON</td>
</tr>
<tr>
<td>Continuous Batching</td>
<td>ON</td>
</tr>
<tr>
<td>MTP</td>
<td>ON</td>
</tr>
<tr>
<td>MTP n-max</td>
<td>5</td>
</tr>
<tr>
<td>MTP Draft K</td>
<td>q4_0</td>
</tr>
<tr>
<td>MTP Draft V</td>
<td>q4_0</td>
</tr>
<tr>
<td>Reasoning</td>
<td>OFF</td>
</tr>
<tr>
<td>CPU Threads</td>
<td>4</td>
</tr>
</tbody>
</table>
<p dir="auto">对应参数大致如下：</p>
<pre><code class="language-bash">--gpu-layers all
--no-host
--fit off
--load-mode mmap
--parallel 1
--kv-unified
--kv-unified-per-slot 98304
--cache-type-k q8_0
--cache-type-v q4_1
--cache-ram 1024
--cache-prompt
--cache-reuse 256
--batch-size 512
--ubatch-size 512
--flash-attn on
--cont-batching
--spec-type draft-mtp
--spec-draft-n-max 5
--spec-draft-type-k q4_0
--spec-draft-type-v q4_0
--reasoning off
--jinja
--chat-template-file &lt;qwen-agent-chat-template&gt;
--threads 4
--threads-batch 4
</code></pre>
<p dir="auto">这些参数并不是所谓的“最佳答案”。</p>
<p dir="auto">它们只是我在：</p>
<p dir="auto"><strong>i5-2400 + 16GB DDR3 + RX 7900 XTX 24GB</strong></p>
<p dir="auto">这台机器上，经过实际 Coding Agent Workload 后，目前觉得性能、显存占用和稳定性比较平衡的一组配置。</p>
<p dir="auto">不同 RAM、Context、模型 conversion 和使用方式，最佳值都会不同。</p>
]]></description><link>https://lcz.me/topic/1508</link><generator>RSS for Node</generator><lastBuildDate>Tue, 08 Sep 2026 00:50:42 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1508.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 05 Sep 2026 04:21:44 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 15 年老平台 + 单张 RX 7900 XTX 跑 Qwen3.8-27B：本地 Coding Agent 实测 on Tue, 08 Sep 2026 00:27:11 GMT]]></title><description><![CDATA[<p dir="auto">谢谢大哥分享详实的数据。</p>
<p dir="auto">虽然不想做伸手党，但通读了帖子也没有发现具体是哪个模型。</p>
<p dir="auto">我让AI给总结了一个清单，能麻烦大哥看一下您用的是哪个模型吗？</p>
<h1>Qwen3.8-27B GGUF 模型推荐指南</h1>
<blockquote>
<p dir="auto">参考帖子：<a href="https://lcz.me/topic/1508/6">15 年老平台 + 单张 RX 7900 XTX 跑 Qwen3.8-27B：本地 Coding Agent 实测</a></p>
</blockquote>
<hr />
<h2><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f4cb.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--clipboard" style="height:23px;width:auto;vertical-align:middle" title="📋" alt="📋" /> 帖子核心需求总结</h2>
<p dir="auto">根据 <a href="http://lcz.me" rel="nofollow ugc">lcz.me</a> 帖子（作者 hoyin258），帖主要求的 Qwen3.8-27B 模型需要满足以下条件：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>需求</th>
<th>要求</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>量化格式</strong></td>
<td>Q4_K_M GGUF（约 17-18GB）</td>
</tr>
<tr>
<td><strong>MTP 支持</strong></td>
<td>保留 MTP 5 layers（用于 spec decode 加速）</td>
</tr>
<tr>
<td><strong>Flash Attention</strong></td>
<td>支持</td>
</tr>
<tr>
<td><strong>Chat Template</strong></td>
<td>带 Jinja template（Tool Calling 稳定）</td>
</tr>
<tr>
<td><strong>KV Cache</strong></td>
<td>支持 q8_0/q4_1</td>
</tr>
<tr>
<td><strong>用途</strong></td>
<td>Coding Agent（长 Context、多轮 Tool Calling）</td>
</tr>
<tr>
<td><strong>显存</strong></td>
<td>24GB（RX 7900 XTX）</td>
</tr>
</tbody>
</table>
<hr />
<h2><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f50d.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--mag" style="height:23px;width:auto;vertical-align:middle" title="🔍" alt="🔍" /> Hugging Face 推荐模型</h2>
<h3><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> 推荐 1（最匹配）：unsloth/Qwen3.8-27B-GGUF</h3>
<ul>
<li><strong>链接</strong>: <a href="https://huggingface.co/unsloth/Qwen3.8-27B-GGUF" rel="nofollow ugc">https://huggingface.co/unsloth/Qwen3.8-27B-GGUF</a></li>
<li><strong>下载量</strong>: 1050万次（最热门）</li>
<li><strong>推荐理由</strong>:
<ul>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 提供 <strong>UD-Q4_K_M</strong> 量化（16.5 GB）— 最接近帖主使用的 Q4_K_M</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 提供 <strong>MTP/mtp-Qwen3.8-27B-Q4_0.gguf</strong>（1.37 GB）— MTP 草稿模型</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 提供 <strong>UD-Q4_K_XL</strong>（17.6 GB）— 更接近 17-18GB 范围</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 提供 <strong>UD-Q5_K_M</strong>（19.8 GB）— 如果你的显存足够，质量更好</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 提供 <strong>UD-Q5_K_S</strong>（18.7 GB）— 另一个接近 18GB 的选择</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 带有 <strong>mmproj</strong> 视觉投影器</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 官方添加了 Unsloth 风格 chat template</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> Apache 2.0 许可证</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 由 Unsloth AI（知名量化团队）维护</li>
</ul>
</li>
</ul>
<h4>可用量化版本速查</h4>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>量化</th>
<th>文件大小</th>
<th>BPW</th>
<th>说明</th>
</tr>
</thead>
<tbody>
<tr>
<td>UD-Q4_K_M</td>
<td>16.5 GB</td>
<td>~4.9</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> 推荐，平衡质量与速度</td>
</tr>
<tr>
<td>UD-Q4_K_XL</td>
<td>17.6 GB</td>
<td>~5.2</td>
<td>比 Q4_K_M 略大略好</td>
</tr>
<tr>
<td>UD-Q5_K_S</td>
<td>18.7 GB</td>
<td>~5.7</td>
<td>质量更高</td>
</tr>
<tr>
<td>UD-Q5_K_M</td>
<td>19.8 GB</td>
<td>~5.9</td>
<td>如果显存允许，推荐此档</td>
</tr>
<tr>
<td>UD-Q6_K</td>
<td>22 GB</td>
<td>~6.6</td>
<td>最高质量</td>
</tr>
</tbody>
</table>
<h4>llama.cpp 启动命令参考</h4>
<pre><code class="language-bash">llama-server \
  -m Qwen3.8-27B-UD-Q4_K_M.gguf \
  --mtp-model MTP/mtp-Qwen3.8-27B-Q4_0.gguf \
  --gpu-layers all \
  --no-host \
  --fit off \
  --load-mode mmap \
  --parallel 1 \
  --kv-unified \
  --kv-unified-per-slot 98304 \
  --cache-type-k q8_0 \
  --cache-type-v q4_1 \
  --cache-ram 1024 \
  --cache-prompt \
  --cache-reuse 256 \
  --batch-size 512 \
  --ubatch-size 512 \
  --flash-attn on \
  --cont-batching \
  --spec-type draft-mtp \
  --spec-draft-n-max 5 \
  --spec-draft-type-k q4_0 \
  --spec-draft-type-v q4_0 \
  --reasoning off \
  --jinja \
  --threads 4 \
  --threads-batch 4
</code></pre>
<hr />
<h3><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> 推荐 2（带 MTP + Vision + 中文优化）：cygnal/Qwen3.8-27B-heretic-ara-Q4_K_M-MTP-GGUF</h3>
<ul>
<li><strong>链接</strong>: <a href="https://huggingface.co/cygnal/Qwen3.8-27B-heretic-ara-Q4_K_M-MTP-GGUF" rel="nofollow ugc">https://huggingface.co/cygnal/Qwen3.8-27B-heretic-ara-Q4_K_M-MTP-GGUF</a></li>
<li><strong>下载量</strong>: 3.5万次</li>
<li><strong>推荐理由</strong>:
<ul>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> <strong>Q4_K_M-MTP</strong> 量化（16 GB）— 已集成 MTP，单文件即用</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 保留完整 MTP tensors（866 个）</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 包含 mmproj 视觉投影器</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 基于 heretic-ara 微调（去除审查、中英双语优化）</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 对 AMD Vulkan 有优化</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 标注了 AMD Strix Halo/RDMA3.5 优化</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 提供 ROCmFP4-FAST 极速量化（14 GB，~42 t/s）</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a0.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--warning" style="height:23px;width:auto;vertical-align:middle" title="⚠" alt="⚠" />️ 下载量较少，社区验证不如 unsloth 充分</li>
<li><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a0.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--warning" style="height:23px;width:auto;vertical-align:middle" title="⚠" alt="⚠" />️ 是"abliterated/uncensored"版本，适合 Coding Agent（更少拒绝回答），但可能更自由奔放</li>
</ul>
</li>
</ul>
<h4>可用量化版本</h4>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>文件</th>
<th>大小</th>
<th>BPW</th>
<th>说明</th>
</tr>
</thead>
<tbody>
<tr>
<td>Qwen3.8-27B-heretic-ara-ROCmFP4-FAST.gguf</td>
<td>14 GB</td>
<td>4.26</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a1.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--zap" style="height:23px;width:auto;vertical-align:middle" title="⚡" alt="⚡" /> 最快，~42 t/s，需 ROCmFPX fork</td>
</tr>
<tr>
<td><strong>Qwen3.8-27B-heretic-ara-Q4_K_M-MTP.gguf</strong></td>
<td><strong>16 GB</strong></td>
<td><strong>4.83</strong></td>
<td><strong><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /> 推荐，开箱即用</strong></td>
</tr>
<tr>
<td>Qwen3.8-27B-heretic-ara-Q6_K-MTP.gguf</td>
<td>21 GB</td>
<td>6.56</td>
<td>更高质量</td>
</tr>
<tr>
<td>mmproj-Qwen3.8-27B-heretic-ara-BF16.gguf</td>
<td>931 MB</td>
<td>—</td>
<td>视觉投影器</td>
</tr>
</tbody>
</table>
<h4>llama.cpp 启动命令（单文件版）</h4>
<pre><code class="language-bash">llama-server \
  -m Qwen3.8-27B-heretic-ara-Q4_K_M-MTP.gguf \
  --gpu-layers all \
  --parallel 1 \
  --kv-unified-per-slot 98304 \
  --cache-type-k q8_0 \
  --cache-type-v q4_1 \
  --flash-attn on \
  --cont-batching \
  --cache-prompt \
  --jinja \
  --threads 4
</code></pre>
<hr />
<h3><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f4ca.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--bar_chart" style="height:23px;width:auto;vertical-align:middle" title="📊" alt="📊" /> 各模型对比</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>模型</th>
<th>量化</th>
<th>大小</th>
<th>MTP</th>
<th>Vision</th>
<th>下载量</th>
<th>适合场景</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>unsloth/Qwen3.8-27B-UD-Q4_K_M</strong></td>
<td>Q4_K_M</td>
<td>16.5GB</td>
<td>需额外下载</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /></td>
<td>1050万+</td>
<td>最均衡推荐</td>
</tr>
<tr>
<td>unsloth/Qwen3.8-27B-UD-Q5_K_M</td>
<td>Q5_K_M</td>
<td>19.8GB</td>
<td>需额外下载</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /></td>
<td>—</td>
<td>质量更高</td>
</tr>
<tr>
<td><strong>cygnal/heretic-ara-Q4_K_M-MTP</strong></td>
<td>Q4_K_M</td>
<td>16GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" />内置</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /></td>
<td>3.5万</td>
<td>开箱即用</td>
</tr>
<tr>
<td>unsloth/Qwen3.8-27B-Q4_1</td>
<td>Q4_1</td>
<td>17.5GB</td>
<td>需额外下载</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /></td>
<td>—</td>
<td>接近帖主尺寸</td>
</tr>
</tbody>
</table>
<hr />
<h2><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f4a1.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--bulb" style="height:23px;width:auto;vertical-align:middle" title="💡" alt="💡" /> 最终建议</h2>
<h3>方案 A：最接近帖主配置（推荐）</h3>
<p dir="auto">使用 <strong>unsloth/Qwen3.8-27B-UD-Q4_K_M</strong> + <strong>unsloth 的 MTP 草稿模型</strong>，两者都来自同一团队，兼容性最好。</p>
<pre><code>模型：Qwen3.8-27B-UD-Q4_K_M.gguf（16.5 GB）
MTP：MTP/mtp-Qwen3.8-27B-Q4_0.gguf（1.37 GB）
</code></pre>
<h3>方案 B：开箱即用</h3>
<p dir="auto">使用 <strong>cygnal/Qwen3.8-27B-heretic-ara-Q4_K_M-MTP</strong>，MTP 已内置，单文件即可启动。</p>
<pre><code>模型：Qwen3.8-27B-heretic-ara-Q4_K_M-MTP.gguf（16 GB）
MTP：内置，无需额外文件
</code></pre>
<h3>方案 C：追求更高质量</h3>
<p dir="auto">如果显存足够，使用 <strong>unsloth/Qwen3.8-27B-UD-Q5_K_M</strong>（19.8 GB），在 24GB 显存上也能放下，质量更高。</p>
<hr />
<h2><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f4dd.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--memo" style="height:23px;width:auto;vertical-align:middle" title="📝" alt="📝" /> 重要注意事项</h2>
<h3>1. 模型架构特点</h3>
<p dir="auto">Qwen3.8-27B 采用 <strong>Gated DeltaNet + Gated Attention</strong> 混合架构：</p>
<ul>
<li><strong>64 层</strong>，隐藏维度 5120</li>
<li>Token 词汇表：248,320</li>
<li>原生上下文长度：<strong>262,144 tokens</strong>（可扩展至 1,000,000）</li>
<li>内置 MTP（Multi-Token Prediction）训练</li>
</ul>
<h3>2. Chat Template 对 Tool Calling 的重要性</h3>
<blockquote>
<p dir="auto">"普通 Chat 能跑，并不代表多轮 Agent Tool Loop 一定能跑。"</p>
</blockquote>
<ul>
<li>使用 <code>--jinja</code> 参数启用 Jinja2 模板渲染</li>
<li>推荐使用带 Unsloth 风格 template 的版本</li>
<li>多轮 Tool Calling 稳定性与 Chat Template 强相关</li>
</ul>
<h3>3. MTP 是否保留 Layers 很重要</h3>
<blockquote>
<p dir="auto">"同一个模型、同一个量化名称，不同 conversion 可能完全不同。"</p>
</blockquote>
<ul>
<li>检查 GGUF 文件中是否包含 MTP tensors</li>
<li>unsloth 版本将 MTP 单独放在 <code>MTP/</code> 目录下</li>
<li>cygnal 版本将 MTP 内置在单文件中</li>
</ul>
<h3>4. 显存与量化选择</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>量化</th>
<th>大小</th>
<th>24GB 显存能否放下</th>
<th>推荐程度</th>
</tr>
</thead>
<tbody>
<tr>
<td>Q4_K_M</td>
<td>~16-17GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 可以</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>Q4_K_XL</td>
<td>~17-18GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 可以</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>Q5_K_S</td>
<td>~18-19GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 可以</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>Q5_K_M</td>
<td>~19-20GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 可以</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>Q6_K</td>
<td>~22GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a0.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--warning" style="height:23px;width:auto;vertical-align:middle" title="⚠" alt="⚠" />️ 勉强</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2b50.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--star" style="height:23px;width:auto;vertical-align:middle" title="⭐" alt="⭐" /></td>
</tr>
<tr>
<td>Q8_0</td>
<td>~29GB</td>
<td><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/274c.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--x" style="height:23px;width:auto;vertical-align:middle" title="❌" alt="❌" /> 放不下</td>
<td>—</td>
</tr>
</tbody>
</table>
<h3>5. 官方原始模型</h3>
<ul>
<li><strong>Hugging Face</strong>: <a href="https://huggingface.co/Qwen/Qwen3.8-27B" rel="nofollow ugc">https://huggingface.co/Qwen/Qwen3.8-27B</a></li>
<li><strong>格式</strong>: Transformers (Safetensors)</li>
<li><strong>特点</strong>: 官方原版，适合 vLLM / SGLang 推理</li>
<li><strong>注意</strong>: 不是 GGUF 格式，需要自行转换或用 Transformers 加载</li>
</ul>
<hr />
<h2><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f517.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--link" style="height:23px;width:auto;vertical-align:middle" title="🔗" alt="🔗" /> 相关链接</h2>
<ul>
<li>原始帖子：<a href="https://lcz.me/topic/1508/6">https://lcz.me/topic/1508/6</a></li>
<li>Unsloth Qwen3.8-27B-GGUF：<a href="https://huggingface.co/unsloth/Qwen3.8-27B-GGUF" rel="nofollow ugc">https://huggingface.co/unsloth/Qwen3.8-27B-GGUF</a></li>
<li>cygnal heretic-ara Q4_K_M-MTP：<a href="https://huggingface.co/cygnal/Qwen3.8-27B-heretic-ara-Q4_K_M-MTP-GGUF" rel="nofollow ugc">https://huggingface.co/cygnal/Qwen3.8-27B-heretic-ara-Q4_K_M-MTP-GGUF</a></li>
<li>官方 Qwen3.8-27B：<a href="https://huggingface.co/Qwen/Qwen3.8-27B" rel="nofollow ugc">https://huggingface.co/Qwen/Qwen3.8-27B</a></li>
<li>llama.cpp 文档：<a href="https://github.com/ggerganov/llama.cpp" rel="nofollow ugc">https://github.com/ggerganov/llama.cpp</a></li>
</ul>
<hr />
<p dir="auto"><em>生成时间：基于 Hugging Face 页面信息，模型更新请以官方页面为准。</em></p>
]]></description><link>https://lcz.me/post/16559</link><guid isPermaLink="true">https://lcz.me/post/16559</guid><dc:creator><![CDATA[coolstar]]></dc:creator><pubDate>Tue, 08 Sep 2026 00:27:11 GMT</pubDate></item><item><title><![CDATA[Reply to 15 年老平台 + 单张 RX 7900 XTX 跑 Qwen3.8-27B：本地 Coding Agent 实测 on Sat, 05 Sep 2026 10:08:51 GMT]]></title><description><![CDATA[<p dir="auto">好的，你整理後舒服多了</p>
]]></description><link>https://lcz.me/post/16017</link><guid isPermaLink="true">https://lcz.me/post/16017</guid><dc:creator><![CDATA[hoyin258]]></dc:creator><pubDate>Sat, 05 Sep 2026 10:08:51 GMT</pubDate></item><item><title><![CDATA[Reply to 15 年老平台 + 单张 RX 7900 XTX 跑 Qwen3.8-27B：本地 Coding Agent 实测 on Sat, 05 Sep 2026 09:49:36 GMT]]></title><description><![CDATA[<p dir="auto">发帖之前让AI整理成markdown，不要发一大串文字。我已经帮你整理一次，以后自己注意格式。</p>
]]></description><link>https://lcz.me/post/16011</link><guid isPermaLink="true">https://lcz.me/post/16011</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Sat, 05 Sep 2026 09:49:36 GMT</pubDate></item><item><title><![CDATA[Reply to 15 年老平台 + 单张 RX 7900 XTX 跑 Qwen3.8-27B：本地 Coding Agent 实测 on Sat, 05 Sep 2026 07:50:28 GMT]]></title><description><![CDATA[<p dir="auto">最终解了。不要在这个平台上升级R 9700 32G。可以看看我的贴子。AMD 显卡最后一档 7900XTX 再升级就拉跨。这个主机比我的还老。</p>
]]></description><link>https://lcz.me/post/15979</link><guid isPermaLink="true">https://lcz.me/post/15979</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Sat, 05 Sep 2026 07:50:28 GMT</pubDate></item><item><title><![CDATA[Reply to 15 年老平台 + 单张 RX 7900 XTX 跑 Qwen3.8-27B：本地 Coding Agent 实测 on Sat, 05 Sep 2026 06:16:35 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/1332d803-f835-4b44-8dde-df34b7cfd905.png" alt="ab3aaef4-4185-4266-ae2b-c1a96ac3111b(1).png" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/15972</link><guid isPermaLink="true">https://lcz.me/post/15972</guid><dc:creator><![CDATA[hoyin258]]></dc:creator><pubDate>Sat, 05 Sep 2026 06:16:35 GMT</pubDate></item><item><title><![CDATA[Reply to 15 年老平台 + 单张 RX 7900 XTX 跑 Qwen3.8-27B：本地 Coding Agent 实测 on Sat, 05 Sep 2026 04:24:25 GMT]]></title><description><![CDATA[<p dir="auto">幸好我加入auto continue 功能，如今跑一组coding</p>
<p dir="auto">两个小时 1千万tok</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/932c329f-4b6b-4c86-bc74-cf90d6496019.jpeg" alt="9e3dde9c-5925-4f57-82a5-e67d1a06f3c7-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/15960</link><guid isPermaLink="true">https://lcz.me/post/15960</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Sat, 05 Sep 2026 04:24:25 GMT</pubDate></item></channel></rss>