H3 整合视频流 测速对比与结论(V0 到 V7)
适用环境:ubuntu24.04,本地 AMD RX 7900 XTX(gfx1100)/ ROCm 7.2 / ComfyUI 8288(H3 专用)
测试物:MiniMax H3 整合视频流,单条 8 秒视频流、固定 6 步 turbo 参数,逐版采样计时
计时口径:只算到采样出片(SaveVideo),不含尾部 4x RealESRGAN 放大
一、测试数据对比
版本
关键改动
相对基线提速
画质
判定
基线(未加 ck-attn)
原始整合流
0%(参考值约 266 秒)
正常
参考基线
V0
仅调启动参数(移除 force-upcast)
中性(165.2 vs 165.8,差异在噪声内)
正常
不靠参数提速
V2
comfy-kitchen 的 ModelAttentionBackend 插在 Sol-Attn 之前
+31.6%
正常
可用,慢一档
V5
LoRA 改 LoraLoaderBypassModelOnly + ck-attn 插在 Sol-Attn 之后
+37.9%
正常(零退化)
胜出(甜点)
V6
关 Sol-Attn,仅留 ck-attn
+37.9%
正常
等同 V5,但关 Sol-Attn 风险略高
V3 / V4 / V7
叠加 TE-Speed 节点
+36% 到 +63%(数字最猛)
水彩化、材质丢光
判负(不可用于成品)
实测锚点:V5 单条 8 秒素材纯采样 165 秒(2 分 45 秒)。基线约 266 秒由「165 秒 / (1 - 37.9%)」反推,属估算值,绝对数以 V5=165 秒为准。
二、结论(给复现者的硬结论)
在 gfx1100 / ROCm 7.2 上复现 H3 提速,照抄 V5 模型链顺序:
INT8FastLoader → LoraLoaderBypassModelOnly → MiniMaxH3FastPatch(Sol-Attn, [true,true]) → ModelAttentionBackend(comfy kitchen) → MiniMaxH3SigmaShift([12,3]) → Guider
这条拿到 +37.9% 且画质零损失,是当前唯一「又快又不糊」的甜点配置。
不要上 TE-Speed(V3 / V4 / V7 那一脉):6 步 turbo 流下虽然提速数字更猛(+36% 到 +63%),但画面水彩化、材质丢失,成品不可用,直接判负。
ck-attn 的位置决定速度上限:插在 Sol-Attn 之后(V5)才拿到满速 +37.9%;插在之前(V2)只有 +31.6%。Sol-Attn 被 ck-attn 接管后即失效,所以 V6(关 Sol-Attn)与 V5 同速。
启动参数铁律:--use-pytorch-cross-attention 必须保留(gfx1100 正确最快路径,启用 AOTriton/CK SDPA);--force-upcast-attention 把 attention 钉 fp32,实测移除中性无提升且更省显存,已固化移除。
三、学习要点(一句话版)
要快且不糊:抄 V5 链路,禁用 TE-Speed。
提速来自「comfy-kitchen attention 节点插在官方 Sol-Attn 之后」+「LoRA 走 Bypass 版保 INT8 fast path」,不是靠调启动参数。
画质优先于极限提速:TE-Speed 的数字陷阱已经踩过,别再走。
计时只到采样出片;端到端含 4x 放大会更长。