<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[# 2xRadeon AI PRO R9700 跑 MiniMax H3：Dual-Sage 双卡 Attention + 1.5× 高分辨率二次生成实测]]></title><description><![CDATA[<h1>2xRadeon AI PRO R9700 跑 MiniMax H3：Dual-Sage 双卡优化 + 1.5× 高分辨率实测</h1>
<p dir="auto">2× AMD Radeon AI PRO R9700 32GB 跑 MiniMax H3。</p>
<p dir="auto">目标：<strong>利用两张 GPU 的算力生成 H3 视频</strong></p>
<p dir="auto">工作流：</p>
<pre><code class="language-text">864×480 H3 PASS1
→ 1.5× Learned Latent Upscale
→ 1312×736 H3 PASS2 refinement
</code></pre>
<p dir="auto">实测结果：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>时长</th>
<th style="text-align:right">Frames</th>
<th style="text-align:right">PASS2 分辨率</th>
<th style="text-align:right">PASS2</th>
<th style="text-align:right">总时间</th>
<th>结果</th>
</tr>
</thead>
<tbody>
<tr>
<td>10s</td>
<td style="text-align:right">243</td>
<td style="text-align:right">1312×736</td>
<td style="text-align:right"><strong>72.62 s/it</strong></td>
<td style="text-align:right"><strong>10:48</strong></td>
<td>成功</td>
</tr>
<tr>
<td>12s</td>
<td style="text-align:right">294</td>
<td style="text-align:right">1312×736</td>
<td style="text-align:right"><strong>95.43 s/it</strong></td>
<td style="text-align:right"><strong>13:38</strong></td>
<td>成功</td>
</tr>
<tr>
<td>15s</td>
<td style="text-align:right">~360</td>
<td style="text-align:right">1312×736</td>
<td style="text-align:right">~117 s/it（OOM 前）</td>
<td style="text-align:right">—</td>
<td>OOM</td>
</tr>
</tbody>
</table>
<p dir="auto"><strong>10 秒稳定，12 秒可以完成但接近 32GB 显存上限，15 秒目前在 PASS2 OOM。</strong></p>
<hr />
<h2>一、机器配置</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>硬件</th>
<th>配置</th>
</tr>
</thead>
<tbody>
<tr>
<td>CPU</td>
<td>AMD Ryzen 5 5600X</td>
</tr>
<tr>
<td>主板</td>
<td>ASUS ROG Strix B550-E</td>
</tr>
<tr>
<td>PCIe</td>
<td>PCIe 4.0 x8/x8</td>
</tr>
<tr>
<td>GPU</td>
<td><strong>2× AMD Radeon AI PRO R9700 32GB</strong></td>
</tr>
<tr>
<td>GPU 架构</td>
<td>RDNA4 / <code>gfx1201</code></td>
</tr>
<tr>
<td>内存</td>
<td>64GB</td>
</tr>
<tr>
<td>系统</td>
<td>Ubuntu 26.04 LTS</td>
</tr>
</tbody>
</table>
<h3>ROCm / ComfyUI 环境</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>配置</th>
</tr>
</thead>
<tbody>
<tr>
<td>ComfyUI</td>
<td>Docker</td>
</tr>
<tr>
<td>Docker OS</td>
<td>Ubuntu 24.04.4 LTS</td>
</tr>
<tr>
<td>Kernel</td>
<td>7.0.0-30-generic</td>
</tr>
<tr>
<td>Python</td>
<td>3.12.3</td>
</tr>
<tr>
<td>ROCm</td>
<td><strong>7.2.4</strong></td>
</tr>
<tr>
<td>PyTorch</td>
<td><strong>2.9.1+rocm7.2.4</strong></td>
</tr>
<tr>
<td>GPU</td>
<td>2× <code>gfx1201</code></td>
</tr>
<tr>
<td>VRAM</td>
<td>31.86 GiB × 2</td>
</tr>
<tr>
<td>SageAttention</td>
<td><strong>ROCm PR #381</strong></td>
</tr>
<tr>
<td>MultiGPU</td>
<td>ComfyUI-MultiGPU</td>
</tr>
</tbody>
</table>
<p dir="auto">PyTorch 在 ROCm 下仍使用 <code>torch.cuda</code> API，所以日志中的 <code>cuda:0</code> / <code>cuda:1</code> 实际对应两张 AMD R9700。</p>
<hr />
<h2>二、双 GPU 分工</h2>
<p dir="auto">两张 R9700 并不是简单平均分配整个 H3 模型：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>GPU0</th>
<th>GPU1</th>
</tr>
</thead>
<tbody>
<tr>
<td>Text Encoder</td>
<td>MiniMax H3 DiT</td>
</tr>
<tr>
<td>Video VAE</td>
<td>Sampler</td>
</tr>
<tr>
<td>Learned Latent Upscaler</td>
<td>Dual-Sage root</td>
</tr>
<tr>
<td>Dual-Sage helper</td>
<td></td>
</tr>
</tbody>
</table>
<p dir="auto">Dual-Sage 在 <strong>SageAttention ROCm PR #381</strong> 基础上，把 56 个 attention heads 拆成：</p>
<pre><code class="language-text">GPU1 / root   → 28 heads
GPU0 / helper → 28 heads
</code></pre>
<p dir="auto">Synthetic Sage benchmark：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th style="text-align:right">结果</th>
</tr>
</thead>
<tbody>
<tr>
<td>Dual-Sage split</td>
<td style="text-align:right">28+28</td>
</tr>
<tr>
<td>Synthetic speedup</td>
<td style="text-align:right"><strong>1.5675×</strong></td>
</tr>
</tbody>
</table>
<p dir="auto">这里的 1.5675× 是 <strong>Attention benchmark</strong>，不是整个 H3 workflow 的加速比。</p>
<hr />
<h2>三、工作流</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>配置</th>
</tr>
</thead>
<tbody>
<tr>
<td>H3 Model</td>
<td><code>10Eros_Max_h3_TURBO-hybrid_beta4_int8_convrot.safetensors</code></td>
</tr>
<tr>
<td>Quantisation</td>
<td>INT8 / Mixed Precision</td>
</tr>
<tr>
<td>Attention</td>
<td>SageAttention ROCm PR #381</td>
</tr>
<tr>
<td>Multi-GPU Attention</td>
<td>Dual-Sage 28+28</td>
</tr>
<tr>
<td>FFN</td>
<td>FeedForward Chunking</td>
</tr>
<tr>
<td>PASS1</td>
<td>864×480</td>
</tr>
<tr>
<td>Latent Upscale</td>
<td>1.5×</td>
</tr>
<tr>
<td>PASS2</td>
<td>1312×736</td>
</tr>
</tbody>
</table>
<p dir="auto">工作流：</p>
<pre><code class="language-text">864×480
→ H3 PASS1
→ Learned Latent Upscale 1.5×
→ 1312×736
→ H3 PASS2 refinement
→ VAE Decode
</code></pre>
<p dir="auto">重点是 upscale 后<strong>重新进入 H3 做第二次 refinement</strong>，而不是 VAE decode 后做普通视频 upscale。</p>
<hr />
<h2>七、目前结论</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>Duration</th>
<th style="text-align:right">Frames</th>
<th style="text-align:right">PASS2</th>
<th style="text-align:right">Speed</th>
<th style="text-align:right">GPU1 VRAM</th>
<th>Result</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>10s</strong></td>
<td style="text-align:right">243</td>
<td style="text-align:right">1312×736</td>
<td style="text-align:right"><strong>72.62 s/it</strong></td>
<td style="text-align:right">~27.5 GB</td>
<td>成功</td>
</tr>
<tr>
<td><strong>12s</strong></td>
<td style="text-align:right">294</td>
<td style="text-align:right">1312×736</td>
<td style="text-align:right"><strong>95.43 s/it</strong></td>
<td style="text-align:right">~30.3 GB</td>
<td>成功</td>
</tr>
<tr>
<td><strong>15s</strong></td>
<td style="text-align:right">360</td>
<td style="text-align:right">1312×736</td>
<td style="text-align:right"><strong>~117 s/it</strong></td>
<td style="text-align:right">~31.2 GB+</td>
<td>OOM</td>
</tr>
</tbody>
</table>
<hr />
<p dir="auto">OOM 并不是发生在 SageAttention，而是在 PASS2 的 <strong>QKV / LoRA</strong> 路径：</p>
<pre><code class="language-text">qkv_proj(x)
→ LoRA adapter
→ out * scale
→ OOM
</code></pre>
<p dir="auto">当时 PyTorch 需要额外申请约：</p>
<pre><code class="language-text">4.18 GiB
</code></pre>
<p dir="auto">所以目前 15 秒的主要限制是 GPU1 的 <strong>temporary activation VRAM peak</strong>。</p>
<p dir="auto">目前已经实现：</p>
<pre><code class="language-text">2× R9700 32GB
+ ROCm 7.2.4
+ SageAttention ROCm PR #381
+ Dual-Sage 28+28
+ GPU0/GPU1 workload separation
+ 864×480 PASS1
+ 1.5× Latent Upscale
+ 1312×736 PASS2
</code></pre>
<p dir="auto"><strong>10 秒稳定完成，12 秒已经验证可以完成；15 秒目前卡在 PASS2 QKV / LoRA 的显存峰值。</strong></p>
]]></description><link>https://lcz.me/topic/1469</link><generator>RSS for Node</generator><lastBuildDate>Mon, 07 Sep 2026 19:29:44 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1469.rss" rel="self" type="application/rss+xml"/><pubDate>Wed, 02 Sep 2026 10:42:20 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to # 2xRadeon AI PRO R9700 跑 MiniMax H3：Dual-Sage 双卡 Attention + 1.5× 高分辨率二次生成实测 on Thu, 03 Sep 2026 16:10:54 GMT]]></title><description><![CDATA[<p dir="auto">引誘我再買一張R9700...</p>
]]></description><link>https://lcz.me/post/15719</link><guid isPermaLink="true">https://lcz.me/post/15719</guid><dc:creator><![CDATA[XXX]]></dc:creator><pubDate>Thu, 03 Sep 2026 16:10:54 GMT</pubDate></item><item><title><![CDATA[Reply to # 2xRadeon AI PRO R9700 跑 MiniMax H3：Dual-Sage 双卡 Attention + 1.5× 高分辨率二次生成实测 on Wed, 02 Sep 2026 11:08:51 GMT]]></title><description><![CDATA[<p dir="auto">非常好，多发点实际截图，显卡照片。R700也是论坛神卡，全能战神。</p>
]]></description><link>https://lcz.me/post/15497</link><guid isPermaLink="true">https://lcz.me/post/15497</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 02 Sep 2026 11:08:51 GMT</pubDate></item></channel></rss>