<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[双 A10 运行：Qwen3.8-Flash-Next 非统一内存异构推理实测]]></title><description><![CDATA[<p dir="auto">前排提醒：楼主社畜今天要上班，所以这些测试是交给 <strong>Codex</strong> 完成的，具体细节没有完全核实。</p>
<p dir="auto">昨天 Qwen3.8-Flash-Next 正式发布，官方公布的能力和效率数据都很亮眼，鉴于Qwen3.8-27B优秀的表现，所以我产生了在本地部署的想法。</p>
<p dir="auto">不过，这个模型即使采用 Q4_K_XL 量化，文件仍有约 103.69 GiB，已经远超普通消费级显卡或双卡平台的总显存。我的本地机器目前内存容量也不够，如果决定长期运行，还需要再增加一组内存。</p>
<p dir="auto">在直接购买硬件之前，我权衡了一下，决定先租用一台双 A10 24GB、128GB 系统内存的服务器，做一次完整的异构推理测试。</p>
<p dir="auto"><strong>省流：</strong></p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>配置</th>
<th style="text-align:right">Prompt 512</th>
<th style="text-align:right">生成速度</th>
</tr>
</thead>
<tbody>
<tr>
<td>单 A10＋CPU，12/48 层进显存</td>
<td style="text-align:right">305.71 tok/s</td>
<td style="text-align:right">10.66 tok/s</td>
</tr>
<tr>
<td>双 A10＋CPU，24/48 层进显存</td>
<td style="text-align:right">361.66 tok/s</td>
<td style="text-align:right">13.91 tok/s</td>
</tr>
<tr>
<td>双 A10＋CPU，但总共仍只放12层</td>
<td style="text-align:right">292.12 tok/s</td>
<td style="text-align:right">8.91 tok/s</td>
</tr>
<tr>
<td>完全 CPU</td>
<td style="text-align:right">55.29 tok/s</td>
<td style="text-align:right">9.07 tok/s</td>
</tr>
<tr>
<td>双 A10＋CPU-MoE</td>
<td style="text-align:right">73.65 tok/s</td>
<td style="text-align:right">12.76 tok/s</td>
</tr>
</tbody>
</table>
<p dir="auto">双卡主配置相对单卡：</p>
<ul>
<li>Prefill 提升约 18.3%</li>
<li>生成速度提升约 30.4%</li>
<li>但双卡本身不会自动加速。相同12层拆到两张无 P2P 的显卡后，反而比单卡更慢。</li>
</ul>
<p dir="auto">双卡主配置的长上下文速度：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>上下文</th>
<th style="text-align:right">Prefill</th>
<th style="text-align:right">生成速度</th>
</tr>
</thead>
<tbody>
<tr>
<td>32K</td>
<td style="text-align:right">211.59 tok/s</td>
<td style="text-align:right">9.41 tok/s</td>
</tr>
<tr>
<td>64K</td>
<td style="text-align:right">136.42 tok/s</td>
<td style="text-align:right">7.74 tok/s</td>
</tr>
<tr>
<td>130K</td>
<td style="text-align:right">85.01 tok/s</td>
<td style="text-align:right">4.45 tok/s</td>
</tr>
</tbody>
</table>
<p dir="auto">一句话总结：<strong>单 A10＋CPU 约 10.7 tok/s，双 A10＋CPU 约 13.9 tok/s；到 130K 上下文时双卡约 4.45 tok/s。双卡的收益来自装入更多权重，而不是两张卡的算力直接叠加。</strong></p>
]]></description><link>https://lcz.me/topic/1355</link><generator>RSS for Node</generator><lastBuildDate>Wed, 23 Sep 2026 05:48:34 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1355.rss" rel="self" type="application/rss+xml"/><pubDate>Thu, 27 Aug 2026 06:54:11 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 双 A10 运行：Qwen3.8-Flash-Next 非统一内存异构推理实测 on Thu, 27 Aug 2026 07:12:03 GMT]]></title><description><![CDATA[<h2>完整测试数据表</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>测试类型</th>
<th>配置/上下文</th>
<th style="text-align:right">GPU层数</th>
<th style="text-align:right">CPU-MoE</th>
<th style="text-align:right">Prompt/Prefill</th>
<th style="text-align:right">Generation</th>
<th>峰值RSS/资源</th>
<th>备注</th>
</tr>
</thead>
<tbody>
<tr>
<td>短基准</td>
<td>双A10主配置</td>
<td style="text-align:right">24</td>
<td style="text-align:right">否</td>
<td style="text-align:right">361.66 tok/s</td>
<td style="text-align:right">13.907 tok/s</td>
<td>RSS约67.7 GiB；显存约19/19 GiB</td>
<td>当前综合最优</td>
</tr>
<tr>
<td>单卡对照</td>
<td>单A10</td>
<td style="text-align:right">12</td>
<td style="text-align:right">否</td>
<td style="text-align:right">305.71 tok/s</td>
<td style="text-align:right">10.663 tok/s</td>
<td>RSS约86.4 GiB；GPU1未使用</td>
<td>单卡+CPU异构</td>
</tr>
<tr>
<td>双卡流水对照</td>
<td>双A10，总计仍为12层</td>
<td style="text-align:right">12</td>
<td style="text-align:right">否</td>
<td style="text-align:right">292.12 tok/s</td>
<td style="text-align:right">8.909 tok/s</td>
<td>RSS约86.5 GiB</td>
<td>比单卡更慢，decode波动较大</td>
</tr>
<tr>
<td>纯CPU对照</td>
<td>完全CPU</td>
<td style="text-align:right">0</td>
<td style="text-align:right">否</td>
<td style="text-align:right">55.29 tok/s</td>
<td style="text-align:right">9.065 tok/s</td>
<td>RSS约104.36 GiB；显存0</td>
<td>验证高速内存影响</td>
</tr>
<tr>
<td>CPU-MoE</td>
<td>双A10，全部routed experts在CPU</td>
<td style="text-align:right">24</td>
<td style="text-align:right">48层</td>
<td style="text-align:right">73.65 tok/s</td>
<td style="text-align:right">12.759 tok/s</td>
<td>RSS约102.18 GiB；显存约1.5/2.1 GiB</td>
<td>保留91.7%主配置decode</td>
</tr>
<tr>
<td>API短提示</td>
<td>18-token prompt</td>
<td style="text-align:right">24</td>
<td style="text-align:right">否</td>
<td style="text-align:right">31.03 tok/s</td>
<td style="text-align:right">13.58 tok/s</td>
<td>双卡+CPU</td>
<td>固定开销占比较高</td>
</tr>
<tr>
<td>重复文本</td>
<td>2,207-token prompt</td>
<td style="text-align:right">24</td>
<td style="text-align:right">否</td>
<td style="text-align:right">354.79 tok/s</td>
<td style="text-align:right">12.43 tok/s</td>
<td>双卡+CPU</td>
<td>重复度高，只作乐观上界</td>
</tr>
<tr>
<td>长上下文</td>
<td>32,768 tokens</td>
<td style="text-align:right">24</td>
<td style="text-align:right">否</td>
<td style="text-align:right">211.59 tok/s</td>
<td style="text-align:right">9.41 tok/s</td>
<td>增量耗时156.5秒</td>
<td>从空slot开始</td>
</tr>
<tr>
<td>长上下文</td>
<td>65,536 tokens</td>
<td style="text-align:right">24</td>
<td style="text-align:right">否</td>
<td style="text-align:right">136.42 tok/s</td>
<td style="text-align:right">7.74 tok/s</td>
<td>新增32,772 tokens，耗时242.2秒</td>
<td>复用前32,764 tokens</td>
</tr>
<tr>
<td>极限上下文</td>
<td>130,000 tokens</td>
<td style="text-align:right">24</td>
<td style="text-align:right">否</td>
<td style="text-align:right">85.01 tok/s</td>
<td style="text-align:right">4.45 tok/s</td>
<td>新增64,468 tokens，耗时765.4秒</td>
<td>最终slot约130,031 tokens</td>
</tr>
<tr>
<td>满上下文资源</td>
<td>130K填充完成</td>
<td style="text-align:right">24</td>
<td style="text-align:right">否</td>
<td style="text-align:right">—</td>
<td style="text-align:right">4.45 tok/s</td>
<td>RSS约72.54 GiB；显存22.2/21.4 GiB</td>
<td>系统仍约47 GiB available</td>
</tr>
<tr>
<td>内存带宽</td>
<td>1线程</td>
<td style="text-align:right">—</td>
<td style="text-align:right">—</td>
<td style="text-align:right">Copy 14.60 GB/s</td>
<td style="text-align:right">—</td>
<td>Triad 15.41 GB/s</td>
<td>单线程</td>
</tr>
<tr>
<td>内存带宽</td>
<td>8线程</td>
<td style="text-align:right">—</td>
<td style="text-align:right">—</td>
<td style="text-align:right">Copy 77.34 GB/s</td>
<td style="text-align:right">—</td>
<td>Triad 91.30 GB/s</td>
<td>—</td>
</tr>
<tr>
<td>内存带宽</td>
<td>16线程</td>
<td style="text-align:right">—</td>
<td style="text-align:right">—</td>
<td style="text-align:right">Copy 110.12 GB/s</td>
<td style="text-align:right">—</td>
<td>Triad 130.82 GB/s</td>
<td>物理核心数</td>
</tr>
<tr>
<td>内存带宽</td>
<td>32线程</td>
<td style="text-align:right">—</td>
<td style="text-align:right">—</td>
<td style="text-align:right">Copy 112.56 GB/s</td>
<td style="text-align:right">—</td>
<td>Triad 133.42 GB/s</td>
<td>SMT增益很小</td>
</tr>
<tr>
<td>PCIe</td>
<td>GPU0 Host→Device</td>
<td style="text-align:right">—</td>
<td style="text-align:right">—</td>
<td style="text-align:right">23.95 GB/s</td>
<td style="text-align:right">—</td>
<td>PCIe 4.0 x16</td>
<td>—</td>
</tr>
<tr>
<td>PCIe</td>
<td>GPU1 Host→Device</td>
<td style="text-align:right">—</td>
<td style="text-align:right">—</td>
<td style="text-align:right">23.91 GB/s</td>
<td style="text-align:right">—</td>
<td>PCIe 4.0 x16</td>
<td>—</td>
</tr>
<tr>
<td>PCIe</td>
<td>GPU0/1 Device→Host</td>
<td style="text-align:right">—</td>
<td style="text-align:right">—</td>
<td style="text-align:right">26.30/26.29 GB/s</td>
<td style="text-align:right">—</td>
<td>PCIe 4.0 x16</td>
<td>—</td>
</tr>
<tr>
<td>本地显存</td>
<td>GPU0/GPU1</td>
<td style="text-align:right">—</td>
<td style="text-align:right">—</td>
<td style="text-align:right">558.04/558.06 GB/s</td>
<td style="text-align:right">—</td>
<td>ECC关闭</td>
<td>两卡对称</td>
</tr>
<tr>
<td>跨卡能力</td>
<td>GPU0<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2194.png?v=efcae6a46b1" class="not-responsive emoji emoji-android emoji--left_right_arrow" style="height:23px;width:auto;vertical-align:middle" title="↔" alt="↔" />GPU1</td>
<td style="text-align:right">—</td>
<td style="text-align:right">—</td>
<td style="text-align:right">P2P不支持</td>
<td style="text-align:right">—</td>
<td>无NVLink，经主机桥接</td>
<td>单向中转约20.2 GB/s</td>
</tr>
</tbody>
</table>
]]></description><link>https://lcz.me/post/14289</link><guid isPermaLink="true">https://lcz.me/post/14289</guid><dc:creator><![CDATA[Bunsei]]></dc:creator><pubDate>Thu, 27 Aug 2026 07:12:03 GMT</pubDate></item><item><title><![CDATA[Reply to 双 A10 运行：Qwen3.8-Flash-Next 非统一内存异构推理实测 on Thu, 27 Aug 2026 07:15:31 GMT]]></title><description><![CDATA[<h3>本地平台与升级目标</h3>
<p dir="auto">我的本地平台配置如下：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>配置</th>
</tr>
</thead>
<tbody>
<tr>
<td>CPU</td>
<td>AMD Ryzen 7 9700X，8 核 16 线程</td>
</tr>
<tr>
<td>主显卡</td>
<td>AMD Radeon AI PRO R9700，32GB GDDR6</td>
</tr>
<tr>
<td>第二张显卡</td>
<td>AMD Radeon RX 9070，16GB GDDR6</td>
</tr>
<tr>
<td>显存总容量</td>
<td>48GB，但两卡容量为非对称的 32GB＋16GB</td>
</tr>
<tr>
<td>当前系统内存</td>
<td>2×24GB DDR5-6000 C28，双通道，标称共 48GB</td>
</tr>
<tr>
<td>计划升级</td>
<td>再增加一组 2×24GB，达到 96GB 系统内存</td>
</tr>
<tr>
<td>操作系统</td>
<td>Ubuntu 26.04 64 位</td>
</tr>
<tr>
<td>GPU 计算环境</td>
<td>ROCm 7.14</td>
</tr>
</tbody>
</table>
<p dir="auto">因此，我真正想模拟的本地部署环境并不是“双 R9700”，而是：</p>
<pre><code class="language-text">Ryzen 7 9700X
├─ R9700 32GB
├─ RX 9070 16GB
└─ 计划升级至 96GB DDR5 系统内存
</code></pre>
<p dir="auto">两张本地显卡合计也是 48GB 显存，与云服务器的双 A10 24GB＋24GB在总容量上非常接近。不过两者的显存分布不同：双 A10 是对称的 24GB＋24GB，本地则是非对称的 32GB＋16GB。</p>
<p dir="auto">因此，云端测试使用的 1:1 分层比例不能直接照搬到本地。实际部署时，需要让 R9700 承担更多模型层和运行缓冲区，RX 9070 承担较少部分，同时继续把 PLE 表及放不下的权重留在系统内存中。</p>
<h3>云端测试平台</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>云服务器配置</th>
</tr>
</thead>
<tbody>
<tr>
<td>云平台</td>
<td>阿里云 ECS，KVM 虚拟机</td>
</tr>
<tr>
<td>CPU</td>
<td>Intel Xeon Platinum 8369B</td>
</tr>
<tr>
<td>CPU 规模</td>
<td>16 个物理核心、32 个逻辑线程</td>
</tr>
<tr>
<td>NUMA</td>
<td>单 NUMA 节点</td>
</tr>
<tr>
<td>系统内存</td>
<td>标称 128GB，系统可见约 123.3GiB</td>
</tr>
<tr>
<td>持续内存带宽</td>
<td>Copy 约 112.56GB/s，Triad 约 133.42GB/s</td>
</tr>
<tr>
<td>GPU</td>
<td>2×NVIDIA A10 24GB</td>
</tr>
<tr>
<td>CUDA 可用显存</td>
<td>每卡约 24,115MiB</td>
</tr>
<tr>
<td>GPU 互联</td>
<td>无 NVLink，不支持 CUDA P2P</td>
</tr>
<tr>
<td>PCIe</td>
<td>两卡均为 PCIe 4.0 x16</td>
</tr>
<tr>
<td>Host→GPU</td>
<td>约 23.9–24.1GB/s</td>
</tr>
<tr>
<td>GPU→Host</td>
<td>约 26.3GB/s</td>
</tr>
<tr>
<td>GPU 间主机中转</td>
<td>单向约 20.2GB/s</td>
</tr>
<tr>
<td>操作系统</td>
<td>Ubuntu 22.04.5 LTS</td>
</tr>
<tr>
<td>推理引擎</td>
<td>llama.cpp Flash-Next 开发分支</td>
</tr>
<tr>
<td>模型</td>
<td>Unsloth UD-Q4_K_XL，四分片 GGUF</td>
</tr>
<tr>
<td>模型大小</td>
<td>103.688GiB</td>
</tr>
</tbody>
</table>
<h3>两个平台的可比性</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>对比项</th>
<th>本地目标平台</th>
<th>云端测试平台</th>
</tr>
</thead>
<tbody>
<tr>
<td>GPU</td>
<td>R9700 32GB＋RX 9070 16GB</td>
<td>A10 24GB＋A10 24GB</td>
</tr>
<tr>
<td>标称总显存</td>
<td>48GB</td>
<td>48GB</td>
</tr>
<tr>
<td>显存分布</td>
<td>非对称，32GB＋16GB</td>
<td>对称，24GB＋24GB</td>
</tr>
<tr>
<td>系统内存</td>
<td>计划升级至 96GB</td>
<td>128GB，系统可见约 123.3GiB</td>
</tr>
<tr>
<td>内存类型</td>
<td>双通道 DDR5，升级后为四根 DIMM</td>
<td>多通道服务器 DDR4</td>
</tr>
<tr>
<td>内存带宽</td>
<td>尚需升级后实测</td>
<td>持续 Copy 约 112.56GB/s</td>
</tr>
<tr>
<td>GPU 软件栈</td>
<td>ROCm</td>
<td>CUDA</td>
</tr>
<tr>
<td>主要用途</td>
<td>最终本地部署</td>
<td>验证架构可行性与性能边界</td>
</tr>
</tbody>
</table>
<p dir="auto">DDR5-6000 双通道的理论带宽为 96GB/s，而云服务器实测的持续 Copy 带宽已经达到约 112.56GB/s，超过了本地当前内存配置的理论上限。实际应用带宽通常还会低于理论值。</p>
<p dir="auto">此外，AM5 平台插满四根 DDR5 DIMM 后，内存频率和时序可能需要降低。因此，升级到 96GB 后虽然容量足够，但 CPU offload 和 CPU-MoE 的实际速度很可能低于此次云服务器测试。</p>
<p dir="auto">从容量上看，计划中的 96GB 系统内存加48GB显存，标称总容量约为144GB，容纳103.69GiB模型、运行缓冲区和长上下文缓存具有现实可能性。但 RAM 与 VRAM 并不是可以无条件相加的统一内存池，还会受到单卡显存余量、模型层边界、KV 缓存、计算图缓冲区以及 ROCm placement 支持情况的限制。</p>
<p dir="auto">因此，这次双 A10 测试能够回答的是：</p>
<blockquote>
<p dir="auto">103.69GiB 的 Q4_K_XL 模型，在总显存约48GB、其余权重驻留系统内存的条件下，能否通过 llama.cpp 稳定运行，以及这种方案大致存在怎样的性能边界。</p>
</blockquote>
<p dir="auto">它不能直接保证本地 R9700＋RX 9070 能得到完全相同的速度。正式迁移时，仍需重新验证非对称双卡分层、ROCm 支持、PCIe 拓扑、P2P 状态和升级后的真实内存带宽。</p>
]]></description><link>https://lcz.me/post/14284</link><guid isPermaLink="true">https://lcz.me/post/14284</guid><dc:creator><![CDATA[Bunsei]]></dc:creator><pubDate>Thu, 27 Aug 2026 07:15:31 GMT</pubDate></item></channel></rss>