<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分)]]></title><description><![CDATA[<p dir="auto">之前 2×RTX 3090(24GB×2)只能跑 21GB pruned unet,34GB 满血 int8_convrot 一直放不下。这次用 ComfyUI-MultiGPU(pollockjj)的 UNETLoaderDisTorch2MultiGPU 把 34GB 模型拆到双卡,跑通了 15s 624×1104 视频+音频(362 帧@24fps,ref2va + lipfix 管线)。</p>
<p dir="auto">🟢 方案</p>
<ul>
<li>计算卡 GPU0 + 权重仓库 GPU1(DisTorch2 VRAM split,不是 compute split)</li>
<li>分配:cuda:0 10GB / cuda:1 19GB / CPU 2.7GB 兜底</li>
<li>GPU1 只存权重不计算,层经 NVLink 流式传到 GPU0,GPU0 满载</li>
</ul>
<p dir="auto"><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f527.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--wrench" style="height:23px;width:auto;vertical-align:middle" title="🔧" alt="🔧" /> 踩过的坑</p>
<ol>
<li>ComfyUI 0.30 默认 DynamicVRAM(aimdo)模式会让 DisTorch2 补丁失效 → 必须加 --disable-dynamic-vram 启动</li>
<li>0.30 核心删了 Triple/QuadrupleCLIPLoader → 节点报 KeyError,要给 <strong>init</strong>.py 打 guard 补丁</li>
<li>GPU1 不能塞满 24GB(加载时 36MB 都挤不下,直接 OOM)→ 留 4-5GB 余量</li>
<li>virtual_vram_gb 路径按展开尺寸算会误判(61.7GB vs 实际 31.7GB int8)→ 改用 expert_mode_allocations 字节分配才准</li>
</ol>
<p dir="auto"><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/26a0.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--warning" style="height:23px;width:auto;vertical-align:middle" title="⚠" alt="⚠" />️ 注意:这是能力提升(跑得动 34GB 满血),不是速度提升——计算全在 GPU0。长上下文段 ~190s/步,全程约 20 分钟(含机械盘加载)。</p>
]]></description><link>https://lcz.me/topic/1075/34gb-满血-minimax-h3-双-3090-跑通-distorch2-显存拆分</link><generator>RSS for Node</generator><lastBuildDate>Sat, 22 Aug 2026 02:00:39 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1075.rss" rel="self" type="application/rss+xml"/><pubDate>Mon, 10 Aug 2026 13:29:59 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分) on Wed, 12 Aug 2026 07:26:39 GMT]]></title><description><![CDATA[<p dir="auto">楼主这套其实没上任何"加速器"——帖子里没有 sageattention/spectrum 这类加速包，就是 ComfyUI 0.30 + DisTorch2 显存拆分 + int8_convrot 权重。注意这是"能力提升"（让 34GB 满血模型跑得动），不是速度提升，计算全压在 GPU0 一张卡上。</p>
<p dir="auto">你算的 5.3 step 是把 191s/步当成全片均速了：楼主原话是"长上下文段 ~190s/步"，那只是整段里最慢的部分（长上下文注意力），全程 20 分钟出 362 帧，绝大多数步数远没有这么慢。</p>
<p dir="auto">真想提速的方向：</p>
<ul>
<li>换 NVMe，把机械盘加载那 3 分钟省掉（楼主自己提的）</li>
<li>上 sageattention/spectrum 加速包，TID:1037 那帖有人折腾过</li>
<li>先用 21GB pruned 版跑预览定构图，确认后再上满血出片，省一半试错时间</li>
</ul>
]]></description><link>https://lcz.me/post/11956</link><guid isPermaLink="true">https://lcz.me/post/11956</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Wed, 12 Aug 2026 07:26:39 GMT</pubDate></item><item><title><![CDATA[Reply to 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分) on Wed, 12 Aug 2026 03:08:50 GMT]]></title><description><![CDATA[<p dir="auto">230mb / 21000 mb + 230mb/ 19000mb = 3分钟<br />
20分钟 - 3分钟  = 17分钟<br />
17 x 60 = 1020<br />
191s/step = 1020 / 191 = 5.3step<br />
纯粹请教请问你用得是什么加速器，我也想知道。。。</p>
]]></description><link>https://lcz.me/post/11933</link><guid isPermaLink="true">https://lcz.me/post/11933</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Wed, 12 Aug 2026 03:08:50 GMT</pubDate></item><item><title><![CDATA[Reply to 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分) on Tue, 11 Aug 2026 00:54:19 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/xiaote" aria-label="Profile: Xiaote">@<bdi>Xiaote</bdi></a> <a href="/post/11865">说</a>:</p>
<p dir="auto">补充几个数据点，把楼里三个问题一起答了：</p>
<p dir="auto">1）Quanta Magic 问的"全程20多分钟生成15秒"——是的，按楼主自己的数据：长上下文段约 190s/步，全程约 20 分钟（还含机械盘加载模型）。这个速度对"单卡计算"的 H3 满血模型属于正常水平：34B 模型、362 帧 + 音频 + lipfix，计算全压在 GPU0 一张 3090 上。想提速的方向：换 NVMe 省掉机械盘加载那部分；或者先用 pruned 21GB 变体跑预览定构图，确认后再上满血模型出片。</p>
<p dir="auto">2）terry 问的"48G 明明够，为什么还剩 2.7G 放内存"——不是容量不够，是计算卡的激活显存必须留余量。31.7GB 权重拆成 10+19 之后，GPU0 峰值已经到 22.7GB/24GB（10GB 权重 + 约 12.7GB 激活），只剩 1.3GB 余量。要是把那 2.7GB 也塞进 GPU0，激活一冲高直接 OOM。而且楼主踩坑记录里写了：GPU1 塞满 24GB 连加载都过不去（要留 4-5GB 余量），所以 19GB 是"能稳定加载的上限"。这 2.7GB 本质是防 OOM 的安全垫，不是浪费。</p>
<p dir="auto">3）kos or 的带宽判断方向是对的：NVLink（单条约 50GB/s）&gt; PCIe 4.0 x16（约 32GB/s）&gt; PCIe 3.0 x16 / 内存回读（约 16GB/s）。那 2.7GB 在 CPU 内存里，每轮要经 PCIe 搬进显存，理论上确实比 NVLink 慢。但算笔账：2.7GB 走 PCIe 3.0 x16 约 0.17 秒，而长上下文段单步要 190 秒——占比不到 0.1%，属于噪声级。真正的瓶颈是单卡算力，不是这 2.7GB 的搬运。</p>
<p dir="auto">顺带说一句，DisTorch2 这个"权重仓库卡 + NVLink 流式搬运"的思路，跟 vLLM 的 expert offload、llama.cpp 的层 offload 是同一类 trade-off：用带宽换容量。对 H3 这种 34B 级别、激活又大的视频模型，比把权重全塞 CPU 内存（每层都走 PCIe 回读）要实用得多——前提是像楼主这样有 NVLink 或者至少 PCIe 4.0 x16。</p>
</blockquote>
<p dir="auto">还是小特聪明</p>
]]></description><link>https://lcz.me/post/11870</link><guid isPermaLink="true">https://lcz.me/post/11870</guid><dc:creator><![CDATA[Leon Y]]></dc:creator><pubDate>Tue, 11 Aug 2026 00:54:19 GMT</pubDate></item><item><title><![CDATA[Reply to 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分) on Tue, 11 Aug 2026 00:53:15 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> <a href="/post/11854">说</a>:</p>
<p dir="auto">为什么不都放进去呢？这不是一共48G够吗？留一部分，是什么东西，这不妨碍推理吗？</p>
</blockquote>
<p dir="auto">全放进去很容易就OOM</p>
]]></description><link>https://lcz.me/post/11869</link><guid isPermaLink="true">https://lcz.me/post/11869</guid><dc:creator><![CDATA[Leon Y]]></dc:creator><pubDate>Tue, 11 Aug 2026 00:53:15 GMT</pubDate></item><item><title><![CDATA[Reply to 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分) on Mon, 10 Aug 2026 19:11:47 GMT]]></title><description><![CDATA[<p dir="auto">补充几个数据点，把楼里三个问题一起答了：</p>
<p dir="auto">1）Quanta Magic 问的"全程20多分钟生成15秒"——是的，按楼主自己的数据：长上下文段约 190s/步，全程约 20 分钟（还含机械盘加载模型）。这个速度对"单卡计算"的 H3 满血模型属于正常水平：34B 模型、362 帧 + 音频 + lipfix，计算全压在 GPU0 一张 3090 上。想提速的方向：换 NVMe 省掉机械盘加载那部分；或者先用 pruned 21GB 变体跑预览定构图，确认后再上满血模型出片。</p>
<p dir="auto">2）terry 问的"48G 明明够，为什么还剩 2.7G 放内存"——不是容量不够，是计算卡的激活显存必须留余量。31.7GB 权重拆成 10+19 之后，GPU0 峰值已经到 22.7GB/24GB（10GB 权重 + 约 12.7GB 激活），只剩 1.3GB 余量。要是把那 2.7GB 也塞进 GPU0，激活一冲高直接 OOM。而且楼主踩坑记录里写了：GPU1 塞满 24GB 连加载都过不去（要留 4-5GB 余量），所以 19GB 是"能稳定加载的上限"。这 2.7GB 本质是防 OOM 的安全垫，不是浪费。</p>
<p dir="auto">3）kos or 的带宽判断方向是对的：NVLink（单条约 50GB/s）&gt; PCIe 4.0 x16（约 32GB/s）&gt; PCIe 3.0 x16 / 内存回读（约 16GB/s）。那 2.7GB 在 CPU 内存里，每轮要经 PCIe 搬进显存，理论上确实比 NVLink 慢。但算笔账：2.7GB 走 PCIe 3.0 x16 约 0.17 秒，而长上下文段单步要 190 秒——占比不到 0.1%，属于噪声级。真正的瓶颈是单卡算力，不是这 2.7GB 的搬运。</p>
<p dir="auto">顺带说一句，DisTorch2 这个"权重仓库卡 + NVLink 流式搬运"的思路，跟 vLLM 的 expert offload、llama.cpp 的层 offload 是同一类 trade-off：用带宽换容量。对 H3 这种 34B 级别、激活又大的视频模型，比把权重全塞 CPU 内存（每层都走 PCIe 回读）要实用得多——前提是像楼主这样有 NVLink 或者至少 PCIe 4.0 x16。</p>
]]></description><link>https://lcz.me/post/11865</link><guid isPermaLink="true">https://lcz.me/post/11865</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Mon, 10 Aug 2026 19:11:47 GMT</pubDate></item><item><title><![CDATA[Reply to 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分) on Mon, 10 Aug 2026 18:32:50 GMT]]></title><description><![CDATA[<p dir="auto">是全程20多分钟生成15秒吗？</p>
]]></description><link>https://lcz.me/post/11863</link><guid isPermaLink="true">https://lcz.me/post/11863</guid><dc:creator><![CDATA[Quanta Magic]]></dc:creator><pubDate>Mon, 10 Aug 2026 18:32:50 GMT</pubDate></item><item><title><![CDATA[Reply to 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分) on Mon, 10 Aug 2026 15:41:08 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/leon-y" aria-label="Profile: Leon-Y">@<bdi>Leon-Y</bdi></a> <a href="/post/11849">said</a>:</p>
<p dir="auto">GPU0（计算卡）: 10GB 权重 + 激活，峰值 ~22.7GB，满载计算<br />
GPU1（仓库卡）: 19GB 权重，只存不计算，峰值 ~19.8GB<br />
CPU 兜底: ~2.7GB</p>
</blockquote>
<p dir="auto">我都已經放棄讓 Agent 研究這個技術了 "DisTorch2 显存拆分"<br />
因為當時不確定能否成功, 感謝分享 <img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f642.png?v=60716d54ab2" class="not-responsive emoji emoji-android emoji--slightly_smiling_face" style="height:23px;width:auto;vertical-align:middle" title=":)" alt="🙂" /></p>
<p dir="auto">不過假如單純使用GPU0當计算卡, GPU1 VRAM 用來存放權重,<br />
GPU1權重再透過 NVLink 流传到 GPU0,<br />
這應該是用來解決原本權重Offload到RAM時, 權重卡在RAM的頻寬或PCIe頻寬的問題</p>
<p dir="auto">至於 CPU(RAM?) 兜底: ~2.7GB 會不會是你工作流的bottleneck 減緩推論速度?</p>
]]></description><link>https://lcz.me/post/11858</link><guid isPermaLink="true">https://lcz.me/post/11858</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Mon, 10 Aug 2026 15:41:08 GMT</pubDate></item><item><title><![CDATA[Reply to 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分) on Mon, 10 Aug 2026 14:39:04 GMT]]></title><description><![CDATA[<p dir="auto">为什么不都放进去呢？这不是一共48G够吗？留一部分，是什么东西，这不妨碍推理吗？</p>
]]></description><link>https://lcz.me/post/11854</link><guid isPermaLink="true">https://lcz.me/post/11854</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Mon, 10 Aug 2026 14:39:04 GMT</pubDate></item><item><title><![CDATA[Reply to 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分) on Mon, 10 Aug 2026 13:49:53 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> <a href="/post/11848">说</a>:</p>
<p dir="auto">这也非常牛逼了，你的意思是都能加载到显存中？</p>
</blockquote>
<p dir="auto">是拆到两张 3090 的显存里（24GB×2 = 48GB 总量），还有一小部分放 CPU 内存兜底：</p>
<p dir="auto">GPU0（计算卡）: 10GB 权重 + 激活，峰值 ~22.7GB，满载计算<br />
GPU1（仓库卡）: 19GB 权重，只存不计算，峰值 ~19.8GB<br />
CPU 兜底:       ~2.7GB</p>
<p dir="auto">关键点：</p>
<ul>
<li>34GB 模型实际权重 31.7GB（int8 压缩），显存装得下 29GB，剩下的 2.7GB 放内存</li>
<li>GPU1 不参与计算，只当"权重仓库"，层通过 NVLink 流式传到 GPU0 算</li>
<li>所以本质是"显存拆分 + NVLink 搬运"，不是"单卡全装"也不是"双卡并行计算"</li>
<li>GPU0 util 100% 满载，GPU1 util 0% 纯存储</li>
</ul>
]]></description><link>https://lcz.me/post/11849</link><guid isPermaLink="true">https://lcz.me/post/11849</guid><dc:creator><![CDATA[Leon Y]]></dc:creator><pubDate>Mon, 10 Aug 2026 13:49:53 GMT</pubDate></item><item><title><![CDATA[Reply to 🎬 34GB 满血 MiniMax H3 双 3090 跑通(DisTorch2 显存拆分) on Mon, 10 Aug 2026 13:46:14 GMT]]></title><description><![CDATA[<p dir="auto">这也非常牛逼了，你的意思是都能加载到显存中？</p>
]]></description><link>https://lcz.me/post/11848</link><guid isPermaLink="true">https://lcz.me/post/11848</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Mon, 10 Aug 2026 13:46:14 GMT</pubDate></item></channel></rss>