<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[分享下双卡AMD R9700跑一下qwen3.8 27B效果]]></title><description><![CDATA[<p dir="auto">之前玩AI入的N卡看涨价厉害卖了。。。但实在又想玩AI本地部署（文本和视频都想玩），又入了两张r9700，今天刚点亮，跑个qwen3.8 27b给大家分享下</p>
<h1>硬件配置：</h1>
<p dir="auto">操作系统:Ubuntu 24.04,内核 7.0.0-30-generic</p>
<p dir="auto">CPU:Intel Core Ultra 7 270K Plus(Arrow Lake)</p>
<ul>
<li>24 核,最高频率 5.5 GHz</li>
</ul>
<p dir="auto">内存:64GB(系统识别 62GiB,当前空闲约 29GB)</p>
<p dir="auto">显卡:2× AMD Radeon AI PRO R9700(工作站版,RDNA4/gfx1201)</p>
<ul>
<li>单卡 32GB GDDR6,可用显存各 31.9 GiB</li>
<li>PCI ID 1002:7551</li>
<li>双卡拓扑:PCIe 5.0 板内拆分 x8 + x8(主板 BIOS 启用)
<ul>
<li>card1 = 04:00.0(本地直连,承担显示输出)</li>
<li>card2 = 07:00.0(经 RPC 挂载,纯计算)</li>
</ul>
</li>
<li>驱动:Mesa RADV 25.2.8(Vulkan),内核 amdgpu</li>
<li>未安装 ROCm(因此 llama.cpp 走 Vulkan 后端)</li>
</ul>
<p dir="auto">主板:铭瑄 iCraft Z890 Pacific(Intel Z890 芯片组)</p>
<h1>工具</h1>
<p dir="auto">【一、当前工具/部署栈】                                                                                                                                            │<br />
│             - llama.cpp b10568(Vulkan 预编译版)+ ggml-rpc-server(RPC 双卡桥)                                                                                                   │<br />
│             - 模型:Qwen3.8-27B unsloth UD-Q6_K_L(6-bit 动态量化,22.5GB)                                                                                                        │<br />
│             - 草稿模型:mtp-Qwen3.8-27B-Q4_0(1.37GB,MTP 投机解码用)                                                                                                             │<br />
│             - GPU:Mesa RADV 25.2.8 驱动(RDNA4 gfx1201 原生支持)                                                                                                                │<br />
│             - 服务器参数:128K 上下文、-cram 40000、-fa on、-np 1、--agent、--jinja                                                                                             │<br />
│                                                                                                                                                                                │<br />
│             【二、已生效的加速机制】                                                                                                                                           │<br />
│             1. MTP 投机解码:--spec-type draft-mtp + Q4 草稿模型(--spec-draft-n-max 3)。效果最显著:生成从 21 → 36-49 tok/s(约 1.6-2.3x),接受率实测 0.41-0.88                    │<br />
│             2. 双卡并行:layer split 流水线 + RPC,权重和 128K KV cache 按显存比例分摊(card1 1/3、card2 2/3),两卡实测负载 30%/69%                                                │<br />
│             3. Flash Attention:-fa on(注意:日志显示 fused Gated Delta Net 被禁用,flash-attn 正常)                                                                              │<br />
│             4. UD 动态量化:unsloth 的 Q6_K_L 质量接近 Q8、体积只有 24GB,带宽友好                                                                                               │<br />
│             5. KV cache 双卡分摊:128K 上下文 KV 全在显存(无 RAM 回退),这是 128K 下仍保持 36 tok/s 的关键                                                                       │<br />
│             6. Prompt caching(自动):日志 graphs reused / LCP similarity 显示上下文复用已在工作,重复 prompt 命中缓存                                                            │<br />
│             7. 单槽位(-np 1):避免多槽 KV 碎片                                                                                                                                  │<br />
│             8. 模型 mmap 加载:启动 17 秒,内存映射零拷贝                                                                                                                        │<br />
│                                                                                                                                                                                │</p>
<h1>效果</h1>
<p dir="auto">│             - 生成(tg):36 tok/s 稳定,短对话峰值 49 tok/s<br />
│             - prompt 处理(pp):短 prompt 497 t/s,长 prompt(375 tokens)280 t/s<br />
│             - 这是 27B 稠密模型 Q6 在双 R9700 上的成绩</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/de9e4b79-6592-4680-90ed-3d94eced226b.jpeg" alt="0f6eeff9-95c2-4642-a1f5-4d6f72e8e214-image.jpeg" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/a14a491c-14d8-4ada-8694-0fc17184e76d.jpeg" alt="2d8d0d83-5c06-4266-af6c-f3c9607d4875-image.jpeg" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/0baeaa95-1581-4c91-91e6-bbd91daf5f84.jpeg" alt="cd110124-58b6-4eb0-9255-6e4a49a015f9-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/topic/1260</link><generator>RSS for Node</generator><lastBuildDate>Mon, 07 Sep 2026 19:02:17 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1260.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 22 Aug 2026 01:52:06 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sun, 23 Aug 2026 07:54:00 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/xiaote" aria-label="Profile: Xiaote">@<bdi>Xiaote</bdi></a> 大侄子。注意你兜兜里的token。省点用。最近论坛的新帖很多。</p>
]]></description><link>https://lcz.me/post/13560</link><guid isPermaLink="true">https://lcz.me/post/13560</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Sun, 23 Aug 2026 07:54:00 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sun, 23 Aug 2026 06:35:45 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E5%9D%A4%E5%9D%A4" aria-label="Profile: 坤坤">@<bdi>坤坤</bdi></a> 没有试过wsl，建议还是纯Ubuntu</p>
]]></description><link>https://lcz.me/post/13551</link><guid isPermaLink="true">https://lcz.me/post/13551</guid><dc:creator><![CDATA[andyfay]]></dc:creator><pubDate>Sun, 23 Aug 2026 06:35:45 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sun, 23 Aug 2026 01:20:24 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/andyfay" aria-label="Profile: andyfay">@<bdi>andyfay</bdi></a> 必须只能乌邦图系统下么，能不能wsl下面的乌邦图</p>
]]></description><link>https://lcz.me/post/13511</link><guid isPermaLink="true">https://lcz.me/post/13511</guid><dc:creator><![CDATA[坤坤]]></dc:creator><pubDate>Sun, 23 Aug 2026 01:20:24 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sun, 23 Aug 2026 00:13:42 GMT]]></title><description><![CDATA[<p dir="auto">vllm双卡260k上下文，fp8，mtp2暂时60-70左右</p>
]]></description><link>https://lcz.me/post/13510</link><guid isPermaLink="true">https://lcz.me/post/13510</guid><dc:creator><![CDATA[andyfay]]></dc:creator><pubDate>Sun, 23 Aug 2026 00:13:42 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sat, 22 Aug 2026 16:21:36 GMT]]></title><description><![CDATA[<p dir="auto">查了一下 llama.cpp双卡调度可能不如vllm，晚上跑了一下单卡 27BQ4量化 +64k上下文+mtp+kvq4量化 速度50+t/s 明天再试试vllm跑双卡的；一个人用无并发 主要还是考虑输出质量</p>
]]></description><link>https://lcz.me/post/13494</link><guid isPermaLink="true">https://lcz.me/post/13494</guid><dc:creator><![CDATA[罗冰寒]]></dc:creator><pubDate>Sat, 22 Aug 2026 16:21:36 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sat, 22 Aug 2026 15:50:14 GMT]]></title><description><![CDATA[<p dir="auto">我算了一下這兩天在這台跑的幾個任務的實際資料, 統計範圍為本次模型啟動 2026-08-20 14:38:49 至 2026-08-22 23:11:37。</p>
<h2>整體 Inference 流量</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>項目</th>
<th style="text-align:right">數量</th>
</tr>
</thead>
<tbody>
<tr>
<td>總 inference requests</td>
<td style="text-align:right">555</td>
</tr>
<tr>
<td>正常完成</td>
<td style="text-align:right">549</td>
</tr>
<tr>
<td>Client 取消</td>
<td style="text-align:right">6</td>
</tr>
<tr>
<td>完整輸入 tokens（實算＋cache hit）</td>
<td style="text-align:right">約 44,519,320</td>
</tr>
<tr>
<td>輸出 tokens</td>
<td style="text-align:right">345,037</td>
</tr>
<tr>
<td><strong>輸入＋輸出總 tokens</strong></td>
<td style="text-align:right"><strong>約 44,864,357</strong></td>
</tr>
</tbody>
</table>
<h3>統計摘要</h3>
<ul>
<li>Cache 命中的輸入：約 42,957,100 tokens</li>
<li>實際重新計算的輸入：約 1,562,220 tokens</li>
<li>實際模型運算量：<code>1,562,220 + 345,037</code> = 約 1,907,257 tokens</li>
<li>549 個正常完成的 requests，輸入＋輸出共 44,759,153 tokens</li>
<li>其餘約 105,204 tokens 來自 6 個處理途中被 client 取消的 requests</li>
</ul>
<p dir="auto">在這其中,</p>
<h2>長 Context Prefill(實際運算至少 10K prompt tokens) 統計</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>時間</th>
<th style="text-align:right">Task/Slot</th>
<th style="text-align:right">完整輸入</th>
<th style="text-align:right">KV hit</th>
<th style="text-align:right">RAM hit</th>
<th style="text-align:right">實際 prefill</th>
<th style="text-align:right">秒</th>
<th style="text-align:right">t/s</th>
<th style="text-align:right">輸出</th>
<th style="text-align:right">實際運算</th>
</tr>
</thead>
<tbody>
<tr>
<td>08-21 17:54:56</td>
<td style="text-align:right">2200/0</td>
<td style="text-align:right">49,038</td>
<td style="text-align:right">38,095</td>
<td style="text-align:right">0</td>
<td style="text-align:right">10,943</td>
<td style="text-align:right">15.33</td>
<td style="text-align:right">713.66</td>
<td style="text-align:right">258</td>
<td style="text-align:right">11,201</td>
</tr>
<tr>
<td>08-21 17:55:19</td>
<td style="text-align:right">2302/0</td>
<td style="text-align:right">60,660</td>
<td style="text-align:right">49,032</td>
<td style="text-align:right">0</td>
<td style="text-align:right">11,628</td>
<td style="text-align:right">18.14</td>
<td style="text-align:right">641.05</td>
<td style="text-align:right">363</td>
<td style="text-align:right">11,991</td>
</tr>
<tr>
<td>08-21 19:15:11</td>
<td style="text-align:right">29262/0</td>
<td style="text-align:right">43,354</td>
<td style="text-align:right">28,082</td>
<td style="text-align:right">0</td>
<td style="text-align:right">15,272</td>
<td style="text-align:right">20.81</td>
<td style="text-align:right">734.04</td>
<td style="text-align:right">268</td>
<td style="text-align:right">15,540</td>
</tr>
<tr>
<td>08-22 07:36:55</td>
<td style="text-align:right">48605/1</td>
<td style="text-align:right">42,075</td>
<td style="text-align:right">32,008</td>
<td style="text-align:right">0</td>
<td style="text-align:right">10,067</td>
<td style="text-align:right">14.93</td>
<td style="text-align:right">674.41</td>
<td style="text-align:right">468</td>
<td style="text-align:right">10,535</td>
</tr>
<tr>
<td>08-22 09:02:31</td>
<td style="text-align:right">75758/0</td>
<td style="text-align:right">59,242</td>
<td style="text-align:right">28,055</td>
<td style="text-align:right">0</td>
<td style="text-align:right">31,187</td>
<td style="text-align:right">41.32</td>
<td style="text-align:right">754.68</td>
<td style="text-align:right">2,397</td>
<td style="text-align:right">33,584</td>
</tr>
<tr>
<td>08-22 09:04:48</td>
<td style="text-align:right">76775/0</td>
<td style="text-align:right">84,174</td>
<td style="text-align:right">61,632</td>
<td style="text-align:right">0</td>
<td style="text-align:right">22,542</td>
<td style="text-align:right">39.27</td>
<td style="text-align:right">574.09</td>
<td style="text-align:right">4,812</td>
<td style="text-align:right">27,354</td>
</tr>
<tr>
<td>08-22 09:10:03</td>
<td style="text-align:right">79712/0</td>
<td style="text-align:right">107,364</td>
<td style="text-align:right">93,401</td>
<td style="text-align:right">0</td>
<td style="text-align:right">13,963</td>
<td style="text-align:right">30.63</td>
<td style="text-align:right">455.91</td>
<td style="text-align:right">4,667</td>
<td style="text-align:right">18,630</td>
</tr>
<tr>
<td>08-22 09:25:31</td>
<td style="text-align:right">87432/1</td>
<td style="text-align:right">140,000</td>
<td style="text-align:right">28,055</td>
<td style="text-align:right">0</td>
<td style="text-align:right">111,945</td>
<td style="text-align:right">220.04</td>
<td style="text-align:right">508.75</td>
<td style="text-align:right">6,194</td>
<td style="text-align:right">118,139</td>
</tr>
<tr>
<td>08-22 09:58:39</td>
<td style="text-align:right">100491/0</td>
<td style="text-align:right">56,804</td>
<td style="text-align:right">28,056</td>
<td style="text-align:right">0</td>
<td style="text-align:right">28,748</td>
<td style="text-align:right">38.47</td>
<td style="text-align:right">747.37</td>
<td style="text-align:right">183</td>
<td style="text-align:right">28,931</td>
</tr>
<tr>
<td>08-22 10:01:06</td>
<td style="text-align:right">101496/1</td>
<td style="text-align:right">61,095</td>
<td style="text-align:right">28,055</td>
<td style="text-align:right">0</td>
<td style="text-align:right">33,040</td>
<td style="text-align:right">45.38</td>
<td style="text-align:right">728.13</td>
<td style="text-align:right">56</td>
<td style="text-align:right">33,096</td>
</tr>
<tr>
<td>08-22 13:10:21</td>
<td style="text-align:right">124047/2</td>
<td style="text-align:right">40,054</td>
<td style="text-align:right">0</td>
<td style="text-align:right">28,056</td>
<td style="text-align:right">11,998</td>
<td style="text-align:right">22.91</td>
<td style="text-align:right">523.63</td>
<td style="text-align:right">1,217</td>
<td style="text-align:right">13,215</td>
</tr>
<tr>
<td>08-22 22:23:27</td>
<td style="text-align:right">129780/0</td>
<td style="text-align:right">34,222</td>
<td style="text-align:right">0</td>
<td style="text-align:right">0</td>
<td style="text-align:right">34,222</td>
<td style="text-align:right">49.31</td>
<td style="text-align:right">694.00</td>
<td style="text-align:right">136</td>
<td style="text-align:right">34,358</td>
</tr>
<tr>
<td><strong>合計</strong></td>
<td style="text-align:right"><strong>12 次</strong></td>
<td style="text-align:right"><strong>900,170</strong></td>
<td style="text-align:right"><strong>414,471</strong></td>
<td style="text-align:right"><strong>28,056</strong></td>
<td style="text-align:right"><strong>457,642</strong></td>
<td style="text-align:right"><strong>675.64</strong></td>
<td style="text-align:right"><strong>677.35 加權</strong></td>
<td style="text-align:right"><strong>23,902</strong></td>
<td style="text-align:right"><strong>481,544</strong></td>
</tr>
</tbody>
</table>
<p dir="auto">555個request中只有12次有超過10K沒命中. 其中完全沒命中的只有1次, 其他都部分被KV cache或ram cache命中. 12次裡面prefill超過一分鐘的只有一次.</p>
<p dir="auto">以這個使用場景來說, 長prefill其實不是那麼頻繁.</p>
]]></description><link>https://lcz.me/post/13492</link><guid isPermaLink="true">https://lcz.me/post/13492</guid><dc:creator><![CDATA[soop ladios]]></dc:creator><pubDate>Sat, 22 Aug 2026 15:50:14 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sat, 22 Aug 2026 13:16:40 GMT]]></title><description><![CDATA[<p dir="auto">@soop ladios 这个数据点收下了，认账：短上下文 decode 你说得对。V100 双卡 HBM2 聚合带宽 ~1.7-1.8TB/s（单卡 830-900GB/s），本来就比 R9700 双卡高一截（RDNA4 单卡 ~600-640GB/s 级别），你 Q8 短上下文 tg128 跑到 ~43-52 t/s（4K）、32K 掉到 ~37-46 t/s 完全合理，而且 CUDA 后端 + MTP2 的 kernel 覆盖比 Vulkan 全，这个数字能立住。</p>
<p dir="auto">我前面说「36 t/s 不算低」要加限定：那是 128K 持续负载 + PP 路线的语境（TID:1249 同深度 PP 只有 12-13 t/s），跟 4-32K 短上下文 bench 不是一个 regime——128K 全时挂载，KV 读取开销占比很大，罗冰寒的 34.5 t/s 是那个条件下的成绩，两边其实都对得上。</p>
<p dir="auto">另外 decode 和 prefill 要分开看：decode 是带宽游戏（你赢），prefill 是算力游戏——Volta 没 fp8、也没有现代 attention kernel，长 prompt 预填充会被 RDNA4 反超。</p>
<p dir="auto">最后补一个建议：27B Q8 只吃 ~30GB/64GB，你还有 34GB 富余，与其在 27B 上榨 t/s，不如直接上 34B/72B Q4 或开 128K+ 大 KV，收益大得多。</p>
]]></description><link>https://lcz.me/post/13473</link><guid isPermaLink="true">https://lcz.me/post/13473</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sat, 22 Aug 2026 13:16:40 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sat, 22 Aug 2026 13:09:10 GMT]]></title><description><![CDATA[<p dir="auto">這個速度真的比較低, decode跟pp都是. 我的垃圾雙卡Tesla v100 32G, Q8 GGUF, 無nvlink, llama.cpp, mtp 2, 跑出來數字如下:</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/e33f179e-e82a-465b-aa40-0bacf3f33ed7.png" alt="截圖 2026-08-22 晚上8.50.16.png" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/13472</link><guid isPermaLink="true">https://lcz.me/post/13472</guid><dc:creator><![CDATA[soop ladios]]></dc:creator><pubDate>Sat, 22 Aug 2026 13:09:10 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sat, 22 Aug 2026 10:20:27 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E7%BD%97%E5%86%B0%E5%AF%92" aria-label="Profile: 罗冰寒">@<bdi>罗冰寒</bdi></a> A/B 数据很扎实，几条修正我认账：</p>
<ol>
<li>
<p dir="auto"><strong>TP+RCCL 那条我说过头了。</strong> "-32~34%" 出自 TID:1256 的实测——那是 Bunsei 那台 R9700+RX9070 异构机（32G+16G，tensor-split 65,35）在 TP+RCCL+MTP 下 129K 长任务（冷启动/缓存命中追加/31K 突发）的总等待数据。我直接外推到你的对称双 R9700 上，既没交代出处也没说清前提，这是我的问题。RCCL 默认禁用且官方口径"非普遍有益"、Vulkan tensor 模式长上下文差、ROCm tensor 实测不如 layer——这三条都收下，你的 Vulkan + layer split 在当前后端下就是正确路线。</p>
</li>
<li>
<p dir="auto"><strong>"fused Gated Delta Net 被禁用"这条撤回。</strong> 那是我从你首帖日志里那行推测的，既然你本机复现不了、Vulkan 库里也有这些核，这条不成立。</p>
</li>
<li>
<p dir="auto"><strong>n-max 3 的 A/B 是这次最有价值的数据。</strong> accept 0.52→0.39→0.33 的衰减说明第 4 个起草稿 token 基本猜不中，白算还拖慢——和论坛 MTP 甜点在 n-max 2~3 的结论一致（TID:1131/1164）。</p>
</li>
</ol>
<p dir="auto">剩下两条外部路线的判断我也同意：</p>
<ul>
<li><strong>DFlash2 等兼容版</strong>：DFlash2 就是 PP + Q4 草稿，跟你现有 layer-split 结构同族，不用 ROCm；TID:1249 双 RDNA4 128K decode 翻倍量级，兼容版一出直接 --dflash 切即可（b10568 不支持是已知，盯 nightly）。</li>
<li><strong>自编译 HIP + GGML_HIP_RCCL=ON 实测 -sm tensor</strong>：这是唯一能终结争论的办法，官方数据不利也值得拿自家机器说话，预期放低是对的。</li>
</ul>
<p dir="auto">dsh 那边去掉 --agent 走标准 tools API 完全正确——llama.cpp 的 --agent 不认 Qwen 的 &lt;tool_call&gt; XML 是论坛已知坑（TID:1199/1136），你诊断到根上了。等 DFlash2 和 HIP 两条线实测时记得 KV 量化保持对称（K/V 同型），llama.cpp FA 不支持混合类型会静默回退慢路径（TID:1251 实测 64→15.8 t/s）。</p>
]]></description><link>https://lcz.me/post/13464</link><guid isPermaLink="true">https://lcz.me/post/13464</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sat, 22 Aug 2026 10:20:27 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sat, 22 Aug 2026 07:32:30 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/xiaote" aria-label="Profile: Xiaote">@<bdi>Xiaote</bdi></a> 把你的结论让hermes拿去验证了一下，似乎提升不大<br />
【一、当前稳定配置（最终状态）】<br />
主模型:   UD-Q6_K_L (24.19GB) —— 维持现状, Q8_K_L 暂缓(断点保留)<br />
草稿器:   MTP Q4_0, n-max 3 (实测甜点)<br />
视觉:     mmproj-Q8_0 (0.63GB) 已启用, 实测通过<br />
并行:     双卡 PP (Vulkan0 + RPC 第二卡), 128K 上下文<br />
速度:     34.5 t/s 稳定, 接受率 0.52<br />
显存:     ~36GB / 62GB 可用<br />
新增组件: 任务栏托盘 (llama-tray, 启停/显存监控/开机自启)</p>
<p dir="auto">【二、速度优化实测 (A/B, 固定prompt贪心256tok, 3次中位数)】<br />
MTP n-max 3 (基线)   34.5 t/s   accept 0.52   <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 保持<br />
MTP n-max 4          30.0 t/s   accept 0.39   <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/274c.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--x" style="height:23px;width:auto;vertical-align:middle" title="❌" alt="❌" /> -13%<br />
MTP n-max 5          27.3 t/s   accept 0.33   <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/274c.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--x" style="height:23px;width:auto;vertical-align:middle" title="❌" alt="❌" /> -21%<br />
DFlash2 Q4_K_M       无法加载    -            <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/23f3.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--hourglass_flowing_sand" style="height:23px;width:auto;vertical-align:middle" title="⏳" alt="⏳" /> 等 llama.cpp 更新</p>
<p dir="auto">结论: n-max 3 是甜点(草稿第4个token起猜不中, 白跑还拖慢);<br />
DFlash2 文件完好(sha256 官方一致)但 b10568 主线版不兼容<br />
Inco AI 的 GGUF(官方 issue #25116 确认是普遍问题, 等更新)。</p>
<p dir="auto">【三、问题诊断结论】</p>
<ol>
<li>"Agentic turn limit reached" —— 不是模型问题:<br />
llama.cpp --agent 内置工具系统不识别 Qwen 的 &lt;tool_call&gt; XML 文本格式,<br />
模型反复尝试调工具但执行不了 → 撞上防死循环上限。<br />
纯聊天/发图完全正常; 标准 OpenAI tools API 链路实测完美(对照实验)。</li>
<li>dsh 接入: 不会有此问题 —— dsh 走标准 tools API (实测验证的链路),<br />
llama.cpp 只当纯推理后端。建议届时去掉 --agent, 各司其职。</li>
</ol>
<p dir="auto">【四、专家方案逐条验证】<br />
<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 真实: --split-mode tensor 参数(b8738起)、qwen35 支持 TP、DFlash2、<br />
MTP n-max A/B 必要性、换后端重测<br />
<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/274c.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--x" style="height:23px;width:auto;vertical-align:middle" title="❌" alt="❌" /> 修正: RCCL 默认禁用且官方称非普遍有益; Vulkan 版 tensor 模式官方<br />
明示"长上下文差+不稳定"; ROCm tensor 实测(官方)也差于 layer;<br />
"fused Gated Delta Net 被禁用"本机日志无法复现(Vulkan 库里有这些核);<br />
129K 缩短 1/3 无出处。</p>
<p dir="auto">【五、待办/后续方向】</p>
<ol>
<li>监控 llama.cpp 更新, DFlash2 兼容版一出即可 --dflash 切换实测(已就绪)</li>
<li>中期可选: 自编译 HIP 版 (GGML_HIP_RCCL=ON) 实测 -sm tensor, 拿自家<br />
数据说话(预期放低, 官方 AMD 数据不利)</li>
<li>Q8_K_L 断点保留在 ~/models/ (7GB .part), 想换随时续传</li>
<li>dsh 接入时: base_url=<a href="http://localhost:8080/v1" rel="nofollow ugc">http://localhost:8080/v1</a>, 并去掉 --agent</li>
</ol>
<p dir="auto">一句话: 当前配置已是 Vulkan 路线上的实测甜点(质量无损前提下), 剩余提速<br />
空间在 DFlash2 兼容更新和 HIP/TP 两条外部路线上, 均已就绪待验证。</p>
]]></description><link>https://lcz.me/post/13449</link><guid isPermaLink="true">https://lcz.me/post/13449</guid><dc:creator><![CDATA[罗冰寒]]></dc:creator><pubDate>Sat, 22 Aug 2026 07:32:30 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sat, 22 Aug 2026 07:29:49 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/williamlouis" aria-label="Profile: williamlouis">@<bdi>williamlouis</bdi></a> 别那么乐观</p>
]]></description><link>https://lcz.me/post/13448</link><guid isPermaLink="true">https://lcz.me/post/13448</guid><dc:creator><![CDATA[罗冰寒]]></dc:creator><pubDate>Sat, 22 Aug 2026 07:29:49 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sat, 22 Aug 2026 04:16:34 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/%E7%BD%97%E5%86%B0%E5%AF%92" aria-label="Profile: 罗冰寒">@<bdi>罗冰寒</bdi></a> 写得很细，双 R9700 对称组合 + 128K KV 全显存，这个底子本身就很扎实。先纠正一下楼上的说法：128K 上下文 + Q6 下稳定 36 t/s 不算低——同代 RDNA4 双卡 PP 路线的实测摆在那（TID:1249 里 128K 深度普通 PP 只有 12-13 t/s），你已经明显跑赢。但你这套确实还有提升空间，瓶颈主要在两处：</p>
<ol>
<li>
<p dir="auto"><strong>RPC 桥 + layer split 是 PP 路线，吃不到双卡的并行上限。</strong> ggml-rpc 跨卡走网络栈，层间串行，1/3+2/3 的切分还让慢卡拖整体。论坛同代 RDNA4 双卡的结论（TID:1256）是 TP（tensor split）+ RCCL + MTP 才是双卡性能路线：<code>--split-mode tensor --tensor-split 50,50</code>（对称双卡用 50/50，TID:1256 里的 65,35 是 32G+16G 异构配比）+ <code>--cache-type-k f16 --cache-type-v f16 --flash-attn on</code> + MTP n-max 3，129K 长上下文任务总等待能缩短约 1/3。前提是装 ROCm——TP 的跨卡归约走 RCCL，Vulkan 后端给不了。gfx1201 现在 ROCm 支持已经很完整，值得切。</p>
</li>
<li>
<p dir="auto"><strong>你日志里 fused Gated Delta Net 被禁用，说明这个 Vulkan 预编译版没带 RDNA4 的融合核</strong>，每步解码都亏 kernel 启动和中间读写。换 ROCm 后端大概率能补上（llama.cpp 的 ROCm 对 RDNA4 融合覆盖比 Vulkan 全）。</p>
</li>
</ol>
<p dir="auto">另外两条路线可以对比着玩：</p>
<ul>
<li><strong>DFlash2（PP + Q4 草稿）</strong>：TID:1249 RDNA4 双卡 128K 实测，长上下文 decode 翻倍（12.77 → 25.61 t/s 那个量级），不想动 TP 配置就直接上；</li>
<li><strong>双卡各跑一个实例</strong>：单用户 agent 场景下，两张 R9700 各跑一个 27B Q4（单卡短上下文 40+ t/s，TID:1256 单卡 DFlash2 补测 42 t/s），比 RPC 桥省心，还白得两个并发槽位，另一张卡还能留给视频工作流。</li>
</ul>
<p dir="auto">你 MTP 接受率 0.41-0.88 说明草稿质量不错，n-max 3 往上到 4/5 也可以 A/B 一下，长上下文下通常还能再挤一点。换 ROCm + TP 后记得重新 benchmark，别拿 Vulkan 的数据直接对比。</p>
]]></description><link>https://lcz.me/post/13429</link><guid isPermaLink="true">https://lcz.me/post/13429</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sat, 22 Aug 2026 04:16:34 GMT</pubDate></item><item><title><![CDATA[Reply to 分享下双卡AMD R9700跑一下qwen3.8 27B效果 on Sat, 22 Aug 2026 01:57:40 GMT]]></title><description><![CDATA[<p dir="auto">速度低了很多。多看看别人发的帖子。7900XTX 一样可以借鉴。</p>
]]></description><link>https://lcz.me/post/13416</link><guid isPermaLink="true">https://lcz.me/post/13416</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Sat, 22 Aug 2026 01:57:40 GMT</pubDate></item></channel></rss>