【練手作品】台風來了,快跑(7900xtx,单条 8 秒素材纯采样 165 秒(2 分 45 秒))
-
这个视频一共生成时间多久啊?
-
海螺H3 需要20分钟左右
-
H3 整合视频流 测速对比与结论(V0 到 V7)
适用环境:ubuntu24.04,本地 AMD RX 7900 XTX(gfx1100)/ ROCm 7.2 / ComfyUI 8288(H3 专用)
测试物:MiniMax H3 整合视频流,单条 8 秒视频流、固定 6 步 turbo 参数,逐版采样计时
计时口径:只算到采样出片(SaveVideo),不含尾部 4x RealESRGAN 放大一、测试数据对比
版本 关键改动 相对基线提速 画质 判定 基线(未加 ck-attn) 原始整合流 0%(参考值约 266 秒) 正常 参考基线 V0 仅调启动参数(移除 force-upcast) 中性(165.2 vs 165.8,差异在噪声内) 正常 不靠参数提速 V2 comfy-kitchen 的 ModelAttentionBackend 插在 Sol-Attn 之前 +31.6% 正常 可用,慢一档 V5 LoRA 改 LoraLoaderBypassModelOnly + ck-attn 插在 Sol-Attn 之后 +37.9% 正常(零退化) 胜出(甜点) V6 关 Sol-Attn,仅留 ck-attn +37.9% 正常 等同 V5,但关 Sol-Attn 风险略高 V3 / V4 / V7 叠加 TE-Speed 节点 +36% 到 +63%(数字最猛) 水彩化、材质丢光 判负(不可用于成品) 实测锚点:V5 单条 8 秒素材纯采样 165 秒(2 分 45 秒)。基线约 266 秒由「165 秒 / (1 - 37.9%)」反推,属估算值,绝对数以 V5=165 秒为准。
二、结论(给复现者的硬结论)
-
在 gfx1100 / ROCm 7.2 上复现 H3 提速,照抄 V5 模型链顺序:
INT8FastLoader → LoraLoaderBypassModelOnly → MiniMaxH3FastPatch(Sol-Attn, [true,true]) → ModelAttentionBackend(comfy kitchen) → MiniMaxH3SigmaShift([12,3]) → Guider
这条拿到 +37.9% 且画质零损失,是当前唯一「又快又不糊」的甜点配置。 -
不要上 TE-Speed(V3 / V4 / V7 那一脉):6 步 turbo 流下虽然提速数字更猛(+36% 到 +63%),但画面水彩化、材质丢失,成品不可用,直接判负。
-
ck-attn 的位置决定速度上限:插在 Sol-Attn 之后(V5)才拿到满速 +37.9%;插在之前(V2)只有 +31.6%。Sol-Attn 被 ck-attn 接管后即失效,所以 V6(关 Sol-Attn)与 V5 同速。
-
启动参数铁律:--use-pytorch-cross-attention 必须保留(gfx1100 正确最快路径,启用 AOTriton/CK SDPA);--force-upcast-attention 把 attention 钉 fp32,实测移除中性无提升且更省显存,已固化移除。
三、学习要点(一句话版)
- 要快且不糊:抄 V5 链路,禁用 TE-Speed。
- 提速来自「comfy-kitchen attention 节点插在官方 Sol-Attn 之后」+「LoRA 走 Bypass 版保 INT8 fast path」,不是靠调启动参数。
- 画质优先于极限提速:TE-Speed 的数字陷阱已经踩过,别再走。
- 计时只到采样出片;端到端含 4x 放大会更长。
-