<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[ROCm 7.14 与 ROCm 10.0：llama.cpp Q8 160K 双卡实测]]></title><description><![CDATA[<p dir="auto">下午摸鱼的时候无意中发现 ROCm发布10.0了 （其实本质上是7.15<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f921.png?v=301515bb865" class="not-responsive emoji emoji-android emoji--clown_face" style="height:23px;width:auto;vertical-align:middle" title=":clown_face:" alt="🤡" />），不过看他版本号跨度这么大，想必定是有什么过人之处，于是让Codex替我盘盘他。</p>
<h3><strong>省流：</strong></h3>
<blockquote>
<p dir="auto"><strong>与 ROCm 7.14 没啥差别。</strong></p>
</blockquote>
<h4><strong>测试平台：</strong></h4>
<p dir="auto">GPU：Radeon AI PRO R9700 32GB + Radeon RX 9070 16GB<br />
设备顺序：<code>HIP_VISIBLE_DEVICES=1,0</code><br />
功耗上限：R9700 210W，RX 9070 200W<br />
llama.cpp： <code>d3371929bb1b6982cf73f1e54156d3d426cd80a1</code><br />
ROCm 7 镜像：<code>local/llama.cpp-rocm:7.14.0-gfx1201-rccl</code><br />
ROCm 10 镜像：<code>local/llama.cpp-rocm:10.0.0-gfx1201-rccl</code><br />
编译参数：<code>GGML_HIP=ON</code>、<code>GGML_HIP_RCCL=ON</code>、<code>GGML_HIP_GRAPHS=ON</code>、<code>AMDGPU_TARGETS=gfx1201</code><br />
模型：<code>Qwen3.8-27B HauhauCS-Aggressive Q8_K_P</code><br />
mmproj：<code>BF16</code><br />
KV：<code>FP16</code><br />
上下文：<code>160K</code>、<code>parallel=1</code><br />
双卡：<code>split-mode=tensor</code>、<code>tensor-split=65,35</code>、<code>RCCL</code><br />
MTP：<code>n-max=3</code><br />
每轮请求：<code>160K token</code> 输入，<code>128 token</code> 输出，<code>cache_prompt=false</code></p>
<h4><strong>结论</strong></h4>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>核心指标</th>
<th style="text-align:right">ROCm 7.14</th>
<th style="text-align:right">ROCm 10.0</th>
<th style="text-align:right">ROCm 10 相对变化</th>
</tr>
</thead>
<tbody>
<tr>
<td>160K 冷 Prefill</td>
<td style="text-align:right">370.759 t/s</td>
<td style="text-align:right">370.740 t/s</td>
<td style="text-align:right">-0.005%</td>
</tr>
<tr>
<td>Decode</td>
<td style="text-align:right">35.721 t/s</td>
<td style="text-align:right">37.281 t/s</td>
<td style="text-align:right"><strong>+4.366%</strong></td>
</tr>
<tr>
<td>端到端墙钟</td>
<td style="text-align:right">445.170 秒</td>
<td style="text-align:right">445.058 秒</td>
<td style="text-align:right">-0.025%</td>
</tr>
</tbody>
</table>
<ol>
<li><strong>Prefill 持平。</strong> 两版均值仅差 0.020 t/s，远小于两轮自然波动，不构成性能差异。</li>
<li><strong>Decode 有小幅、稳定收益。</strong> ROCm 10 两轮分别为 37.291、37.271 t/s；ROCm 7 两轮为 35.717、35.726 t/s，提升约 4.37%。</li>
<li><strong>MTP 行为一致。</strong> 四轮接受率均为 89/113，即 78.761%，因此 Decode 差异不是由接受率变化造成的。</li>
<li><strong>端到端无收益。</strong> ROCm 10 平均墙钟只少 0.111 秒；对一次约 7 分 25 秒的请求，这一差异不可感知。</li>
</ol>
]]></description><link>https://lcz.me/topic/1452</link><generator>RSS for Node</generator><lastBuildDate>Wed, 09 Sep 2026 22:53:35 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1452.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 01 Sep 2026 08:09:41 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to ROCm 7.14 与 ROCm 10.0：llama.cpp Q8 160K 双卡实测 on Wed, 09 Sep 2026 02:49:39 GMT]]></title><description><![CDATA[<p dir="auto">之前有查詢ROCM 10主要是為了MI400出的，跟R9700的RDNA4一點關係都沒有。</p>
]]></description><link>https://lcz.me/post/16824</link><guid isPermaLink="true">https://lcz.me/post/16824</guid><dc:creator><![CDATA[paul hou]]></dc:creator><pubDate>Wed, 09 Sep 2026 02:49:39 GMT</pubDate></item><item><title><![CDATA[Reply to ROCm 7.14 与 ROCm 10.0：llama.cpp Q8 160K 双卡实测 on Wed, 09 Sep 2026 02:14:38 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/johnnybegood" aria-label="Profile: johnnybegood">@<bdi>johnnybegood</bdi></a><br />
<a class="plugin-mentions-user plugin-mentions-a" href="/user/kos-or" aria-label="Profile: kos-or">@<bdi>kos-or</bdi></a></p>
<p dir="auto">个人实测得出的，而且更小的量化格式并不一定代表速度更快，具体原因我猜测可能跟数据结构有关，毕竟没有原生“6位格式”，处理时候可能会更麻烦？不过如果你能跑Q8量化，那么说明肯定是双卡，直接上vLLM、FP8格式的模型速度更快，双卡下在接近160K+上下文的情况下能稳定1000+的预填充速度解码开启MTP之后也能三四十。</p>
]]></description><link>https://lcz.me/post/16817</link><guid isPermaLink="true">https://lcz.me/post/16817</guid><dc:creator><![CDATA[Bunsei]]></dc:creator><pubDate>Wed, 09 Sep 2026 02:14:38 GMT</pubDate></item><item><title><![CDATA[Reply to ROCm 7.14 与 ROCm 10.0：llama.cpp Q8 160K 双卡实测 on Tue, 08 Sep 2026 22:29:51 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/bunsei" aria-label="Profile: Bunsei">@<bdi>Bunsei</bdi></a> <a href="/post/15320">said</a>:</p>
<p dir="auto">Q8的速度在agent工作负载下是比Q6快很多的</p>
</blockquote>
<p dir="auto">請問 這是因為Q8 有硬體解碼的因素嗎？<br />
所以只要 VRAM裝得下, Q8/FP8 速度上 &gt; Q6/Q4 ?</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/54785d6e-a54f-47a5-aa77-f2948fcfe168.jpeg" alt="754790cb-5629-4949-ad54-5f1bbfb5c4a2-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/16791</link><guid isPermaLink="true">https://lcz.me/post/16791</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Tue, 08 Sep 2026 22:29:51 GMT</pubDate></item><item><title><![CDATA[Reply to ROCm 7.14 与 ROCm 10.0：llama.cpp Q8 160K 双卡实测 on Tue, 08 Sep 2026 16:32:33 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/bunsei" aria-label="Profile: Bunsei">@<bdi>Bunsei</bdi></a> 为啥呢？</p>
]]></description><link>https://lcz.me/post/16760</link><guid isPermaLink="true">https://lcz.me/post/16760</guid><dc:creator><![CDATA[johnnybegood]]></dc:creator><pubDate>Tue, 08 Sep 2026 16:32:33 GMT</pubDate></item><item><title><![CDATA[Reply to ROCm 7.14 与 ROCm 10.0：llama.cpp Q8 160K 双卡实测 on Tue, 08 Sep 2026 16:26:09 GMT]]></title><description><![CDATA[<p dir="auto">刚刷到ROCm，就看到坛友发了，确实省流让人佩服。</p>
]]></description><link>https://lcz.me/post/16756</link><guid isPermaLink="true">https://lcz.me/post/16756</guid><dc:creator><![CDATA[lysen963]]></dc:creator><pubDate>Tue, 08 Sep 2026 16:26:09 GMT</pubDate></item><item><title><![CDATA[Reply to ROCm 7.14 与 ROCm 10.0：llama.cpp Q8 160K 双卡实测 on Tue, 01 Sep 2026 08:27:59 GMT]]></title><description><![CDATA[<p dir="auto">另外偷偷说一嘴，其实R9700跑Q8的速度在agent工作负载下是比Q6快很多的，双卡还是尽量跑Q8。</p>
]]></description><link>https://lcz.me/post/15320</link><guid isPermaLink="true">https://lcz.me/post/15320</guid><dc:creator><![CDATA[Bunsei]]></dc:creator><pubDate>Tue, 01 Sep 2026 08:27:59 GMT</pubDate></item><item><title><![CDATA[Reply to ROCm 7.14 与 ROCm 10.0：llama.cpp Q8 160K 双卡实测 on Tue, 01 Sep 2026 08:22:53 GMT]]></title><description><![CDATA[<p dir="auto">很好，省流二字价值连城</p>
]]></description><link>https://lcz.me/post/15318</link><guid isPermaLink="true">https://lcz.me/post/15318</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Tue, 01 Sep 2026 08:22:53 GMT</pubDate></item><item><title><![CDATA[Reply to ROCm 7.14 与 ROCm 10.0：llama.cpp Q8 160K 双卡实测 on Tue, 01 Sep 2026 08:14:41 GMT]]></title><description><![CDATA[<p dir="auto"><strong>启动参数:</strong></p>
<pre><code class="language-bash">docker run -d \
  --name llama-ab \
  --device=/dev/kfd \
  --device=/dev/dri \
  --group-add 44 \
  --group-add 991 \
  --ipc=host \
  --shm-size=16g \
  --security-opt seccomp=unconfined \
  -e HIP_VISIBLE_DEVICES=1,0 \
  -e GGML_CUDA_P2P=1 \
  -e NCCL_DEBUG=WARN \
  -p 8080:8080 \
  -v /home/bunsei/models/GGUF/Qwen3.8-27B-Q8_K_P:/models:ro \
  -v /home/bunsei/.config/llama.cpp/api-key:/run/secrets/llama-api-key:ro \
  local/llama.cpp-rocm:7.14.0-gfx1201-rccl \
  --model /models/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q8_K_P.gguf \
  --mmproj /models/mmproj-BF16.gguf \
  --gpu-layers all \
  --gpu-layers-draft all \
  --fit off \
  --ctx-size 163840 \
  --parallel 1 \
  --batch-size 2048 \
  --ubatch-size 512 \
  --kv-unified \
  --cache-type-k f16 \
  --cache-type-v f16 \
  --cache-type-k-draft f16 \
  --cache-type-v-draft f16 \
  --kv-offload \
  --flash-attn on \
  --split-mode tensor \
  --tensor-split 65,35 \
  --spec-type draft-mtp \
  --spec-draft-n-max 3 \
  --cache-idle-slots \
  --ctx-checkpoints 8 \
  --checkpoint-min-step 8192 \
  --image-min-tokens 1024 \
  --reasoning-format deepseek \
  --host 0.0.0.0 \
  --port 8080 \
  --ui 
</code></pre>
]]></description><link>https://lcz.me/post/15317</link><guid isPermaLink="true">https://lcz.me/post/15317</guid><dc:creator><![CDATA[Bunsei]]></dc:creator><pubDate>Tue, 01 Sep 2026 08:14:41 GMT</pubDate></item><item><title><![CDATA[Reply to ROCm 7.14 与 ROCm 10.0：llama.cpp Q8 160K 双卡实测 on Tue, 01 Sep 2026 08:11:19 GMT]]></title><description><![CDATA[<h3><strong>原始结果</strong></h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>运行时</th>
<th style="text-align:right">轮次</th>
<th style="text-align:right">Prefill t/s</th>
<th style="text-align:right">Decode t/s</th>
<th style="text-align:right">Prompt 秒</th>
<th style="text-align:right">Decode 秒</th>
<th style="text-align:right">墙钟秒</th>
<th style="text-align:right">MTP 接受率</th>
</tr>
</thead>
<tbody>
<tr>
<td>ROCm 7.14</td>
<td style="text-align:right">1</td>
<td style="text-align:right">372.374</td>
<td style="text-align:right">35.717</td>
<td style="text-align:right">439.644</td>
<td style="text-align:right">3.500</td>
<td style="text-align:right">443.323</td>
<td style="text-align:right">78.761%</td>
</tr>
<tr>
<td>ROCm 7.14</td>
<td style="text-align:right">2</td>
<td style="text-align:right">369.145</td>
<td style="text-align:right">35.726</td>
<td style="text-align:right">443.490</td>
<td style="text-align:right">3.499</td>
<td style="text-align:right">447.016</td>
<td style="text-align:right">78.761%</td>
</tr>
<tr>
<td>ROCm 10.0</td>
<td style="text-align:right">1</td>
<td style="text-align:right">371.095</td>
<td style="text-align:right">37.291</td>
<td style="text-align:right">441.159</td>
<td style="text-align:right">3.352</td>
<td style="text-align:right">444.728</td>
<td style="text-align:right">78.761%</td>
</tr>
<tr>
<td>ROCm 10.0</td>
<td style="text-align:right">2</td>
<td style="text-align:right">370.384</td>
<td style="text-align:right">37.271</td>
<td style="text-align:right">442.006</td>
<td style="text-align:right">3.354</td>
<td style="text-align:right">445.389</td>
<td style="text-align:right">78.761%</td>
</tr>
</tbody>
</table>
]]></description><link>https://lcz.me/post/15315</link><guid isPermaLink="true">https://lcz.me/post/15315</guid><dc:creator><![CDATA[Bunsei]]></dc:creator><pubDate>Tue, 01 Sep 2026 08:11:19 GMT</pubDate></item></channel></rss>