<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[双 R9700 部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频，工具已经免费，专注内容]]></title><description><![CDATA[<p dir="auto">两张AI Pro R9700，一张sglang 部署qwen3.8-27b awq，一张comfyui，完整配置，hermes操控视频生成。</p>
<p dir="auto">sglang速度可接受，长上下文decode不衰减，llamacpp需要用到内存，影响comfyui，所以不能用了comfyui，内存条太贵，64g刚够用。</p>
<p dir="auto">comfyui 质量0.4，10步，15s用时20-25min左右。无人值守生成视频（试了才知道，做视频是个辛苦活，写脚本不容易）</p>
<p dir="auto">如下供参考</p>
<h1>双 R9700 (RDNA4 / gfx1201) 单宿主部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频</h1>
<p dir="auto">一台机器、两张 R9700 (RDNA4 / gfx1201, 32G)，各挂一个 systemd 服务<strong>并行</strong>跑：GPU1 跑 SGLang 256K 上下文大模型，GPU0 跑 ComfyUI 生成 MiniMax H3 视频。配置全部<strong>从实际运行进程逐参数核实</strong>，含每个参数的作用、AMD 特定点、显存分配逻辑，以及 50K→250K 的 prefill/decode 实测数据和 H3 视频尺寸/质量结论。直接可抄。</p>
<hr />
<h2>1. 硬件与环境</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项</th>
<th>值</th>
</tr>
</thead>
<tbody>
<tr>
<td>GPU</td>
<td>2× AMD Radeon PRO R9700（RDNA4，gfx1201），各 32GB VRAM</td>
</tr>
<tr>
<td>分工</td>
<td><strong>GPU1 = SGLang 大模型</strong>（<code>HIP_VISIBLE_DEVICES=1</code>）；<strong>GPU0 = ComfyUI 视频生成</strong>（<code>HIP_VISIBLE_DEVICES=0</code>）</td>
</tr>
<tr>
<td>内存</td>
<td>宿主 64G RAM（ComfyUI 单元限 60~62G，<code>OOMScoreAdjust=-500</code> 保命）</td>
</tr>
<tr>
<td>软件栈</td>
<td>ROCm（<code>/opt/rocm</code>）</td>
</tr>
<tr>
<td>SGLang</td>
<td>stock <code>0.5.16</code> + <strong>sglang-rdna4 社区 fork</strong>（通过 <code>PYTHONPATH</code> 覆盖，关键！）</td>
</tr>
<tr>
<td>Python</td>
<td>3.12.13（miniforge env <code>sglang-triton36</code>）</td>
</tr>
<tr>
<td>模型</td>
<td>mattbucci <code>Qwen3.8-27B-AWQ</code>（AWQ int4 量化，含多模态）</td>
</tr>
<tr>
<td>架构</td>
<td><code>Qwen3_5ForConditionalGeneration</code>（model_type <code>qwen3_5</code>）</td>
</tr>
</tbody>
</table>
<blockquote>
<p dir="auto"><strong>要点</strong>：gfx1201 (RDNA4) 不在 ROCm 官方支持列表，stock sglang 跑不起来。需要 (a) <code>HSA_OVERRIDE_GFX_VERSION=12.0.1</code> 把 target 映射到已识别的 gfx 版本，(b) 用适配 RDNA4 的 sglang fork。单卡 32G 靠 AWQ int4 权重 + fp8 KV cache 才塞下 256K。</p>
<p dir="auto"><strong>双卡隔离</strong>：两个服务用 <code>HIP_VISIBLE_DEVICES</code> 分别钉到 GPU1 / GPU0，互不抢卡、并行跑。SGLang 占满 GPU1，ComfyUI 独占 GPU0 跑 H3 视频生成，互不干扰。</p>
</blockquote>
<hr />
<h2>2. 启动命令</h2>
<pre><code class="language-bash">python -m sglang.launch_server \
  --model-path /path/to/Qwen3.8-27B-AWQ \
  --quantization awq \
  --served-model-name qwen3.8-27b \
  --enable-multimodal \
  --dtype bfloat16 \
  --kv-cache-dtype fp8_e4m3 \
  --context-length 262144 \
  --mem-fraction-static 0.85 \
  --max-running-requests 1 \
  --num-continuous-decode-steps 16 \
  --chunked-prefill-size 8192 \
  --max-prefill-tokens 16384 \
  --cuda-graph-backend-decode full \
  --attention-backend triton \
  --max-mamba-cache-size 8 \
  --mamba-ssm-dtype bfloat16 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder \
  --trust-remote-code \
  --watchdog-timeout 1200 \
  --host 0.0.0.0 --port 23334
</code></pre>
<h3>参数逐项说明</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>参数</th>
<th>值</th>
<th>为什么</th>
</tr>
</thead>
<tbody>
<tr>
<td><code>--quantization awq</code></td>
<td>awq</td>
<td>权重 AWQ int4，省显存</td>
</tr>
<tr>
<td><code>--dtype bfloat16</code></td>
<td>bfloat16</td>
<td>激活/中间张量精度（权重仍按 int4 加载）</td>
</tr>
<tr>
<td><code>--kv-cache-dtype</code></td>
<td><strong>fp8_e4m3</strong></td>
<td><strong>核心省显存项</strong>：KV 用 fp8 比 bf16 省一半，是 256K 能跑起来的关键</td>
</tr>
<tr>
<td><code>--context-length</code></td>
<td>262144</td>
<td>256K 上下文</td>
</tr>
<tr>
<td><code>--mem-fraction-static</code></td>
<td><strong>0.85</strong></td>
<td>预留给权重+KV 的显存比例。0.85 在 32G 单卡上稳妥，太高会 OOM</td>
</tr>
<tr>
<td><code>--max-running-requests</code></td>
<td><strong>1</strong></td>
<td>单请求批次，长上下文场景下 decode 最稳最可预测（牺牲并发）</td>
</tr>
<tr>
<td><code>--chunked-prefill-size</code></td>
<td><strong>8192</strong></td>
<td>prefill 按 8K 分块，平衡峰值显存和首 token 延迟</td>
</tr>
<tr>
<td><code>--max-prefill-tokens</code></td>
<td>16384</td>
<td>单批 prefill token 上限</td>
</tr>
<tr>
<td><code>--num-continuous-decode-steps</code></td>
<td>16</td>
<td>连续解码步数，配 cuda graph 降 kernel launch 开销</td>
</tr>
<tr>
<td><code>--cuda-graph-backend-decode</code></td>
<td><strong>full</strong></td>
<td>decode 用完整 graph，AMD 上映射到 HIP graph</td>
</tr>
<tr>
<td><code>--attention-backend</code></td>
<td><strong>triton</strong></td>
<td><strong>AMD 必须</strong>：NVIDIA 的 FA 在 AMD 不可用，走 Triton 版 FlashAttention</td>
</tr>
<tr>
<td><code>--max-mamba-cache-size</code></td>
<td>8</td>
<td>该架构含 mamba/SSM 层，限制其缓存规模</td>
</tr>
<tr>
<td><code>--mamba-ssm-dtype</code></td>
<td>bfloat16</td>
<td>SSM 层精度</td>
</tr>
<tr>
<td><code>--enable-multimodal</code></td>
<td>-</td>
<td>开启视觉（配 mmproj）</td>
</tr>
<tr>
<td><code>--reasoning-parser</code></td>
<td>qwen3</td>
<td>解析 <code>think</code> 推理块</td>
</tr>
<tr>
<td><code>--tool-call-parser</code></td>
<td>qwen3_coder</td>
<td>tool call 解析</td>
</tr>
<tr>
<td><code>--watchdog-timeout</code></td>
<td><strong>1200</strong></td>
<td><strong>关键</strong>：20 分钟。256K 长 prefill 单次可达 15min+，默认值会被 watchdog 误杀</td>
</tr>
<tr>
<td><code>--trust-remote-code</code></td>
<td>-</td>
<td>加载模型自定义 code</td>
</tr>
</tbody>
</table>
<hr />
<h2>3. 环境变量（AMD 关键项，放 systemd <code>Environment=</code> 或脚本）</h2>
<pre><code class="language-bash"># 让 ROCm 把不支持的 gfx1201 映射到已知 target
HSA_OVERRIDE_GFX_VERSION=12.0.1
# 指定用哪张卡（0 或 1）
HIP_VISIBLE_DEVICES=1
HIP_PATH=/opt/rocm
ROCM_PATH=/opt/rocm

# AMD 版 FlashAttention 走 Triton
FLASH_ATTENTION_TRITON_AMD_ENABLE=TRUE
# 关掉 AITER（AMD kernel 库）及其 all-reduce —— RDNA4 上稳定性问题
SGLANG_USE_AITER=0
SGLANG_USE_AITER_AR=0
# 关 SDMA 拷贝引擎（稳定性）
HSA_ENABLE_SDMA=0
HSA_FORCE_FINE_GRAIN_PCIE=1
GPU_MAX_HW_QUEUES=8
HIP_FORCE_DEV_KERNARG=1
# 禁 torch tunableop（AMD 上不稳）
PYTORCH_TUNABLEOP_ENABLED=0
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
TOKENIZERS_PARALLELISM=false

# ⚠️ 指向 RDNA4 适配的 sglang fork（本配置能跑起来的另一半关键）
PYTHONPATH=/path/to/sglang-rdna4/components/sglang/python
</code></pre>
<hr />
<h2>4. systemd 服务（完整 unit，可直接抄改）</h2>
<pre><code class="language-ini">[Unit]
Description=SGLang Qwen3.8-27B AWQ int4 single GPU 256K multimodal
After=network.target

[Service]
Type=simple
WorkingDirectory=/home/YOU
Environment="PATH=/path/to/venv/bin:/usr/bin:/bin"
Environment="PYTHONPATH=/path/to/sglang-rdna4/components/sglang/python"
Environment="ROCM_PATH=/opt/rocm"
Environment="HIP_PATH=/opt/rocm"
Environment="HSA_OVERRIDE_GFX_VERSION=12.0.1"
Environment="GPU_MAX_HW_QUEUES=8"
Environment="HIP_FORCE_DEV_KERNARG=1"
Environment="HSA_FORCE_FINE_GRAIN_PCIE=1"
Environment="FLASH_ATTENTION_TRITON_AMD_ENABLE=TRUE"
Environment="PYTORCH_TUNABLEOP_ENABLED=0"
Environment="SGLANG_USE_AITER=0"
Environment="SGLANG_USE_AITER_AR=0"
Environment="HSA_ENABLE_SDMA=0"
Environment="HIP_VISIBLE_DEVICES=1"
Environment="TOKENIZERS_PARALLELISM=false"
Environment="PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True"
ExecStart=/path/to/venv/bin/python -m sglang.launch_server \
    --model-path /path/to/Qwen3.8-27B-AWQ \
    --enable-multimodal --quantization awq \
    --served-model-name qwen3.8-27b \
    --dtype bfloat16 --kv-cache-dtype fp8_e4m3 \
    --context-length 262144 --mem-fraction-static 0.85 \
    --num-continuous-decode-steps 16 --max-running-requests 1 \
    --chunked-prefill-size 8192 --max-prefill-tokens 16384 \
    --cuda-graph-backend-decode full --attention-backend triton \
    --max-mamba-cache-size 8 --mamba-ssm-dtype bfloat16 \
    --reasoning-parser qwen3 --tool-call-parser qwen3_coder \
    --trust-remote-code --watchdog-timeout 1200 \
    --host 0.0.0.0 --port 23334
Restart=on-failure
RestartSec=10
TimeoutStopSec=120

[Install]
WantedBy=default.target
</code></pre>
<blockquote>
<p dir="auto">用户级服务用 <code>systemctl --user</code>，记得 <code>loginctl enable-linger YOURUSER</code> 才能在重启后自动拉起。</p>
</blockquote>
<hr />
<h2>5. 实测性能（单卡 32G，冷 prefill / 每请求强制冷缓存）</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:right">上下文</th>
<th style="text-align:right">prompt_tokens</th>
<th style="text-align:right">首 token (TTFT)</th>
<th style="text-align:right"><strong>Prefill</strong></th>
<th style="text-align:right"><strong>Decode</strong></th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:right">50K</td>
<td style="text-align:right">50,005</td>
<td style="text-align:right">59.6s</td>
<td style="text-align:right"><strong>838 tok/s</strong></td>
<td style="text-align:right"><strong>24.7 tok/s</strong></td>
</tr>
<tr>
<td style="text-align:right">100K</td>
<td style="text-align:right">100,003</td>
<td style="text-align:right">170.0s</td>
<td style="text-align:right"><strong>588 tok/s</strong></td>
<td style="text-align:right"><strong>23.2 tok/s</strong></td>
</tr>
<tr>
<td style="text-align:right">150K</td>
<td style="text-align:right">150,000</td>
<td style="text-align:right">392.2s</td>
<td style="text-align:right"><strong>382 tok/s</strong></td>
<td style="text-align:right"><strong>21.7 tok/s</strong></td>
</tr>
<tr>
<td style="text-align:right">200K</td>
<td style="text-align:right">200,078</td>
<td style="text-align:right">606.2s</td>
<td style="text-align:right"><strong>330 tok/s</strong></td>
<td style="text-align:right"><strong>20.5 tok/s</strong></td>
</tr>
<tr>
<td style="text-align:right">250K</td>
<td style="text-align:right">250,075</td>
<td style="text-align:right">921.2s</td>
<td style="text-align:right"><strong>272 tok/s</strong></td>
<td style="text-align:right"><strong>19.3 tok/s</strong></td>
</tr>
</tbody>
</table>
<p dir="auto"><strong>结论</strong></p>
<ul>
<li><strong>Prefill 随上下文陡降</strong>：50K→250K 从 838 掉到 272 tok/s（约 3× 降）。250K prefill 一次 ~15 分钟，长上下文冷启动要有耐心 / 配合 warm cache。</li>
<li><strong>Decode 基本稳</strong>：24.7 → 19.3 tok/s，仅降 ~22%（单 token 出，KV 长度增长影响有限）。</li>
<li>想要更快首 token：开 radix cache / 复用前缀，或把 <code>--chunked-prefill-size</code> 调大。</li>
</ul>
<hr />
<h2>6. ComfyUI (GPU0) — MiniMax H3 视频生成</h2>
<p dir="auto">GPU0 上跑 ComfyUI 生成 MiniMax H3 视频。模型合计 ~51G（diffusion 20G + text_encoder 26G + 视频 VAE 4.9G + 音频 VAE 0.6G），单张 32G 卡装不下，靠 <code>--lowvram</code> 把权重经系统内存轮流换入显存（以速度换显存）。</p>
<h3>启动命令 / systemd</h3>
<pre><code class="language-ini"># comfyui-gpu0.service
[Service]
Type=simple
WorkingDirectory=/path/to/ComfyUI
Environment="HIP_VISIBLE_DEVICES=0"
Environment="HSA_OVERRIDE_GFX_VERSION=12.0.1"
Environment="GPU_MAX_HW_QUEUES=8"
Environment="PYTORCH_TUNABLEOP_ENABLED=0"
Environment="TOKENIZERS_PARALLELISM=false"
ExecStart=/path/to/ComfyUI/.venv/bin/python3 /path/to/ComfyUI/main.py \
    --listen 0.0.0.0 \
    --port 8189 \
    --lowvram \
    --database-url sqlite:////tmp/comfyui_gpu0.db
Restart=on-failure
RestartSec=10
# 降低 OOM killer 优先级 - 让 ComfyUI 不容易被杀
OOMScoreAdjust=-500
# 允许使用 swap 缓解瞬时内存峰值（--lowvram 依赖大内存换入换出）
MemoryHigh=60G
MemoryMax=62G

[Install]
WantedBy=default.target
</code></pre>
<p dir="auto">关键项：</p>
<ul>
<li><strong><code>--lowvram</code></strong>：H3 全模型 &gt;51G，单卡 32G 装不下，必须开启——权重放系统内存，用时按层换入 GPU。代价是生成变慢，但能跑起来。</li>
<li><strong><code>HIP_VISIBLE_DEVICES=0</code></strong>：钉死 GPU0，和 GPU1 的 SGLang 物理隔离。</li>
<li><strong><code>OOMScoreAdjust=-500</code> + <code>MemoryHigh/Max=60~62G</code></strong>：<code>--lowvram</code> 会吃大量系统 RAM，给 ComfyUI 大内存配额并降低被 OOM killer 优先杀的概率。</li>
<li><strong><code>--database-url sqlite:////tmp/...</code></strong>：用独立 SQLite，避免和别的实例抢库。</li>
</ul>
<h3>MiniMax H3 工作流（本地已有，可直接用）</h3>
<ul>
<li><strong>文生视频 T2V</strong>：<code>ComfyUI/user/default/workflows/MiniMax_H3_T2V_AMD.json</code></li>
<li><strong>图生视频 I2V</strong>：<code>ComfyUI/user/default/workflows/MiniMax_H3_I2V_AMD.json</code></li>
</ul>
<p dir="auto">H3 是 MiniMax 的 omni-modal 生成模型，<strong>原生立体声</strong>（人声/音效/音乐一次前向联合生成，不是后期贴上去）。输出最高 2K / 24fps / ~15s。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>节点</th>
<th>作用</th>
</tr>
</thead>
<tbody>
<tr>
<td><code>4c314f31-...</code>（H3 Generate 节点）</td>
<td>prompt + width/height + duration + 4 个模型文件 → VIDEO</td>
</tr>
<tr>
<td><code>ResolutionSelector</code></td>
<td>设宽高，按 megapixel 档位 + 32 的倍数对齐</td>
</tr>
<tr>
<td><code>SaveVideo</code></td>
<td>输出 mp4</td>
</tr>
<tr>
<td><code>LoadImage</code> + <code>ImageScaleToTotalPixels</code>（I2V）</td>
<td>首帧/参考图，缩到目标总像素</td>
</tr>
</tbody>
</table>
<p dir="auto"><strong>模型文件</strong>（下载到对应目录）：</p>
<pre><code>ComfyUI/models/
├── diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors   (20G)
├── text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors       (26G)
├── vae/minimax_h3_video_vae_fp16.safetensors                            (4.9G)
└── vae/minimax_h3_audio_vae_fp32.safetensors                            (0.6G)
</code></pre>
<p dir="auto">全部来自 <a href="https://huggingface.co/Comfy-Org/MiniMax-H3" rel="nofollow ugc">Comfy-Org/MiniMax-H3</a>。依赖新版 ComfyUI（含 <a href="https://github.com/Comfy-Org/ComfyUI/pull/15224" rel="nofollow ugc">ComfyUI#15224</a> 的 H3 节点），老版本没有这些节点。</p>
<h3>视频尺寸 / 质量 — 建议 0.4MP</h3>
<blockquote>
<p dir="auto"><strong>实测结论：分辨率不要开太高，稳定档位是 <code>0.4</code>。</strong></p>
</blockquote>
<p dir="auto">H3 原生画布 768px 短边，上限 768×1344，按 32 的倍数对齐。<code>ResolutionSelector</code> 的 megapixel 档位对应输出（16:9）：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>megapixels</th>
<th>16:9 输出</th>
<th>说明</th>
</tr>
</thead>
<tbody>
<tr>
<td>0.2</td>
<td>608×352</td>
<td>很小</td>
</tr>
<tr>
<td><strong>0.4</strong></td>
<td><strong>864×480</strong></td>
<td><strong><img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/2705.png?v=2fb7360d8c6" class="not-responsive emoji emoji-android emoji--white_check_mark" style="height:23px;width:auto;vertical-align:middle" title="✅" alt="✅" /> 本机稳定档位</strong></td>
</tr>
<tr>
<td>0.5</td>
<td>960×544</td>
<td>开始吃紧</td>
</tr>
<tr>
<td>0.6</td>
<td>1056×608</td>
<td>更吃紧</td>
</tr>
<tr>
<td>1.0</td>
<td>1376×768</td>
<td>接近上限，32G + lowvram 吃力</td>
</tr>
<tr>
<td>2.0</td>
<td>1920×1088</td>
<td>2K，单卡基本跑不动/很慢</td>
</tr>
</tbody>
</table>
<p dir="auto"><strong>本机实际跑通的视频（ffprobe 实测）</strong>：</p>
<ul>
<li>16:9 文生视频 → <strong>864×480 @24fps, 15s, H.264 + AAC 立体声</strong></li>
<li>1:1 图生视频 → <strong>640×640 @24fps, 15s, H.264 + AAC 立体声</strong></li>
</ul>
<p dir="auto">这些都落在 <strong>0.4MP 档</strong>。在 32G 单卡 + <code>--lowvram</code> 下，0.4 是质量和速度的平衡点；往 0.6/1.0 以上开，要么 OOM 要么慢到不可用。<strong>建议默认 0.4。</strong></p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>维度</th>
<th>建议</th>
</tr>
</thead>
<tbody>
<tr>
<td>分辨率</td>
<td><strong>0.4MP</strong>（16:9 → 864×480；1:1 → 640×640）</td>
</tr>
<tr>
<td>时长</td>
<td>15s（H3 上限约 15s；帧数按 17k+5 网格在 24fps 下对齐）</td>
</tr>
<tr>
<td>帧率</td>
<td>24fps（固定）</td>
</tr>
<tr>
<td>音频</td>
<td>原生立体声 AAC（无需另配）</td>
</tr>
</tbody>
</table>
<hr />
<h2>7. 踩坑清单（AMD 党必看）</h2>
<ol>
<li><strong>stock sglang 跑不了 RDNA4</strong> → 必须 sglang-rdna4 fork（<code>PYTHONPATH</code> 覆盖）+ <code>HSA_OVERRIDE_GFX_VERSION=12.0.1</code>。</li>
<li><strong><code>--watchdog-timeout</code> 必须调大</strong>：256K 单次 prefill &gt;15min，默认 30min 内还好，但并发/重试场景会被误杀，建议 ≥1200s。</li>
<li><strong><code>--kv-cache-dtype fp8_e4m3</code> 是省显存主力</strong>：bf16 KV 在 256K 会爆显存，fp8 直接减半。</li>
<li><strong><code>--attention-backend triton</code></strong>：别用默认，AMD 上默认 FA 路径不可用。</li>
<li><strong>关 AITER / SDMA / tunableop</strong>：RDNA4 上这几个是稳定性和 crash 的主要来源。</li>
<li><strong><code>--max-running-requests 1</code></strong>：单卡长上下文先跑通单请求，并发后续再加。</li>
<li>显存紧张先降 <code>--mem-fraction-static</code>（0.85→0.8）或缩短 <code>--context-length</code>。</li>
<li><strong>双卡务必用 <code>HIP_VISIBLE_DEVICES</code> 物理隔离</strong>：SGLang 钉 <code>=1</code>、ComfyUI 钉 <code>=0</code>，否则两边抢同一张卡互相 OOM。改错卡号 = 服务起不来或抢占崩溃。</li>
<li><strong>H3 模型 &gt;51G，必须 <code>--lowvram</code></strong>：单张 32G 卡装不下，关 lowvram 直接 OOM。代价是生成慢（权重经系统内存换入换出）。</li>
<li><strong>ComfyUI 给足系统内存配额</strong>：<code>--lowvram</code> 吃 RAM，单元里设 <code>MemoryHigh/Max=60~62G</code> + <code>OOMScoreAdjust=-500</code>，否则系统 RAM 不够时 ComfyUI 容易被 OOM killer 先杀掉。</li>
<li><strong>H3 分辨率锁 0.4MP</strong>：开 0.6/1.0/2K 在 32G+lowvram 下要么 OOM 要么慢到不可用。0.4（16:9→864×480、1:1→640×640）是稳定且可用的档。</li>
<li><strong>ComfyUI 要新版</strong>：H3 节点来自 ComfyUI#15224，老版本没有这些节点，会报"missing node type"。</li>
</ol>
]]></description><link>https://lcz.me/topic/1416</link><generator>RSS for Node</generator><lastBuildDate>Mon, 07 Sep 2026 16:51:54 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1416.rss" rel="self" type="application/rss+xml"/><pubDate>Sun, 30 Aug 2026 07:24:35 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 双 R9700 部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频，工具已经免费，专注内容 on Mon, 07 Sep 2026 16:13:23 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a><br />
因為第一張買53000, 隔一周想買第二張時已經變63000,所以掙扎， 再一天就都沒了。</p>
]]></description><link>https://lcz.me/post/16525</link><guid isPermaLink="true">https://lcz.me/post/16525</guid><dc:creator><![CDATA[XXX]]></dc:creator><pubDate>Mon, 07 Sep 2026 16:13:23 GMT</pubDate></item><item><title><![CDATA[Reply to 双 R9700 部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频，工具已经免费，专注内容 on Mon, 07 Sep 2026 16:10:36 GMT]]></title><description><![CDATA[<p dir="auto">只買了一張，後面也不用掙扎了，沒貨了。</p>
]]></description><link>https://lcz.me/post/16522</link><guid isPermaLink="true">https://lcz.me/post/16522</guid><dc:creator><![CDATA[XXX]]></dc:creator><pubDate>Mon, 07 Sep 2026 16:10:36 GMT</pubDate></item><item><title><![CDATA[Reply to 双 R9700 部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频，工具已经免费，专注内容 on Sun, 06 Sep 2026 07:21:00 GMT]]></title><description><![CDATA[<blockquote>
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/xxx" aria-label="Profile: XXX">@<bdi>XXX</bdi></a> <a href="/post/16136">said</a>:</p>
<p dir="auto">掙扎了一周想說買第二張, 結果能找到的價格已經跟上上周買的價格漲了18%...</p>
</blockquote>
<p dir="auto">請問最後是掙扎地買了嗎？還是繼續掙扎中</p>
]]></description><link>https://lcz.me/post/16163</link><guid isPermaLink="true">https://lcz.me/post/16163</guid><dc:creator><![CDATA[kos or]]></dc:creator><pubDate>Sun, 06 Sep 2026 07:21:00 GMT</pubDate></item><item><title><![CDATA[Reply to 双 R9700 部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频，工具已经免费，专注内容 on Sun, 06 Sep 2026 06:15:14 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/xxx" aria-label="Profile: XXX">@<bdi>XXX</bdi></a><br />
你还没买？我以为你直接买了。。。</p>
]]></description><link>https://lcz.me/post/16149</link><guid isPermaLink="true">https://lcz.me/post/16149</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Sun, 06 Sep 2026 06:15:14 GMT</pubDate></item><item><title><![CDATA[Reply to 双 R9700 部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频，工具已经免费，专注内容 on Sun, 06 Sep 2026 04:35:02 GMT]]></title><description><![CDATA[<p dir="auto">掙扎了一周想說買第二張, 結果能找到的價格已經跟上上周買的價格漲了18%...</p>
]]></description><link>https://lcz.me/post/16136</link><guid isPermaLink="true">https://lcz.me/post/16136</guid><dc:creator><![CDATA[XXX]]></dc:creator><pubDate>Sun, 06 Sep 2026 04:35:02 GMT</pubDate></item><item><title><![CDATA[Reply to 双 R9700 部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频，工具已经免费，专注内容 on Sat, 05 Sep 2026 19:03:14 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/tmp-tmp" aria-label="Profile: tmp-tmp">@<bdi>tmp-tmp</bdi></a> 选 SGLang 不是图单流快，是楼主这个场景只有它能同时满足三件事：</p>
<ol>
<li>256K 长上下文不掉速——楼主原话"长上下文 decode 不衰减"。llama.cpp 到长窗尾段容易溢出/重 prefill，SGLang 的 KV 管理和 prefix cache 就是干这个的。</li>
<li>不跟 ComfyUI 抢内存——楼主 64G 内存刚够 ComfyUI offload（H3 fp8 权重 50G+ 塞不进单卡 32G），llama.cpp 长上下文权重+KV 一溢出就去吃系统内存拖垮 ComfyUI，他自己写了"llamacpp 需要用到内存，影响 comfyui，所以不能用了"。</li>
<li>常驻服务适合无人值守——SGLang + systemd 挂机，配脚本/agent 反复调；llama.cpp 单进程长任务挂了就断。</li>
</ol>
<p dir="auto">速度账：27B 单卡 decode 被显存带宽钉死，同硬件同量化下 SGLang 和 llama.cpp 差距是个位数百分比，短上下文单流甚至 llama.cpp 常常更快。SGLang 的钱花在长上下文、并发多路、显存管理上，不是花在把 27B 跑快 5%。</p>
<p dir="auto">反过来说也对：短上下文单用户自用，llama.cpp 完全够，没必要多学一层 SGLang；要 256K 长窗 + 后台常驻 + 旁边还跑着吃显存的东西，才轮到它上场。</p>
]]></description><link>https://lcz.me/post/16070</link><guid isPermaLink="true">https://lcz.me/post/16070</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Sat, 05 Sep 2026 19:03:14 GMT</pubDate></item><item><title><![CDATA[Reply to 双 R9700 部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频，工具已经免费，专注内容 on Sat, 05 Sep 2026 18:50:26 GMT]]></title><description><![CDATA[<p dir="auto">prefile和decode速度好像并不怎么快，为什么要用sglang呀？</p>
]]></description><link>https://lcz.me/post/16069</link><guid isPermaLink="true">https://lcz.me/post/16069</guid><dc:creator><![CDATA[tmp tmp]]></dc:creator><pubDate>Sat, 05 Sep 2026 18:50:26 GMT</pubDate></item><item><title><![CDATA[Reply to 双 R9700 部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频，工具已经免费，专注内容 on Tue, 01 Sep 2026 10:10:31 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/imbiplaza-asus" aria-label="Profile: imbiplaza-ASUS">@<bdi>imbiplaza-ASUS</bdi></a> 这个不用等楼主实测，先给你拆个账，你拿官方 launch 跑一版就能对上：</p>
<ol>
<li>
<p dir="auto"><strong>锚点 = 楼主自己 14906 楼的数据</strong>：quality 0.4、10 步、15s 视频、总耗时 20-25 分钟 → 折算每步约 <strong>120-150 秒</strong>（s/it 是跨整段视频的一次扩散步，不是单帧）</p>
</li>
<li>
<p dir="auto"><strong>双 32G 帮不上忙</strong>：ComfyUI 跑 H3 默认单卡干活，官方 workflow 没有双卡 split，第二张卡闲着。fp8 权重 50GB+ 级别，单卡 32G 放不下 → 约 20-25G 自动 offload 到内存。128G DRAM 容量绰绰有余不会 OOM，但 offload 吃内存带宽（~50GB/s vs 显存 640GB/s），这才是 s/it 的主要拖累。H3 是 hybrid Mamba 结构，只有部分权重走内存，实际大概比全显存慢 2-3 倍，不是 10 倍</p>
</li>
<li>
<p dir="auto"><strong>1.0M 分辨率会更高</strong>：1.0M 像素（约 1088x960 这类）比楼主测的档位像素多，s/it 按像素比例往上走；larry turbo 步数少（官方模板通常 8-12 步），总时长 = s/it x 步数</p>
</li>
<li>
<p dir="auto"><strong>"吃饱吃满"没有额外开关</strong>：ComfyUI 默认按层尽量塞显存、剩余自动 offload，没有 gpu-only 之类的隐藏档位可拉。真想提速就是降分辨率/降时长，或者等官方出 H3 多卡支持</p>
</li>
<li>
<p dir="auto"><strong>最快的验证</strong>：官方模板跑一遍，进度条直接显示 s/it，拿实际数字跟上面账目对一下，误差一般 20% 以内</p>
</li>
</ol>
]]></description><link>https://lcz.me/post/15326</link><guid isPermaLink="true">https://lcz.me/post/15326</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Tue, 01 Sep 2026 10:10:31 GMT</pubDate></item><item><title><![CDATA[Reply to 双 R9700 部署 — GPU1 跑 SGLang 256K 大模型，GPU0 跑 ComfyUI MiniMax H3 视频，工具已经免费，专注内容 on Tue, 01 Sep 2026 03:22:38 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/3a5c6e36-af5b-4177-b44b-6f6c1822741c.png" alt="Screenshot 2026-08-25 191024.png" class=" img-fluid img-markdown" /></p>
<p dir="auto">我想知道，如果以官方的launch 来跑，在128g dram ,双32 vram 的情况下</p>
<p dir="auto">让comfyui 吃饱吃满</p>
<p dir="auto">跑官方h3 模型，1.0m, 15s, larry turbo.</p>
<p dir="auto">他的每一步 s/it 可以去到多少。。。</p>
]]></description><link>https://lcz.me/post/15262</link><guid isPermaLink="true">https://lcz.me/post/15262</guid><dc:creator><![CDATA[imbiplaza ASUS]]></dc:creator><pubDate>Tue, 01 Sep 2026 03:22:38 GMT</pubDate></item></channel></rss>