双R9700跑minimaxH3效果分享
-
《重构人生》H3 视频 —— 跑通环境配置 & 时间基准
日期:2026-08-31 凌晨(最终跑通版)
结论:Ref2VA 测试片(含中文台词 + 字幕)已跑通,此文档记录可复现的环境配置与实测耗时。
一、硬件
- CPU:Intel Ultra 7 270K Plus(24 核 / 62GB 内存)
- GPU:2× AMD Radeon AI PRO R9700 32GB(gfx1201 / RDNA4,PCIe 5.0 x8+x8,无 P2P)
- 系统:Ubuntu 24.04
二、软件栈(关键版本)
组件 版本 torch 2.11.0+rocm7.2(勿用 2.10+rocm7.0=挂死黑屏,勿用 2.12+rocm7.14=DynamicVRAM 卡死) torchvision / torchaudio 0.26.0+rocm7.2 / 2.11.0+rocm7.2 ComfyUI 0.33.0 comfy-kitchen 0.2.31(HIP 后端) comfy-aimdo 0.4.13(DynamicVRAM 未启用,健康态) Python 3.11.16(venv: ~/comfy-h3/venv) 关键软链(comfy-kitchen HIP 原生内核):
ln -sf libamdhip64.so libamdhip64.so.7 # 在 venv/.../torch/lib/ 下
三、启动参数(ComfyUI)
export HSA_XNACK=0 python main.py --listen 127.0.0.1 --port 8188 --reserve-vram 1.0- 不带
--gpu-only(DiT 20GB 会因显存碎片 OOM) HSA_XNACK=0抑制 SVM 页迁移开销- 启动脚本:
~/comfy-h3/start-comfy-rocm7.sh
四、模型文件
角色 文件 大小 DiT 主模型 minimax_h3_fl2va_pruned_int8_convrot.safetensors 20G 文本编码器 TE qwen3vl_32b_minimax_h3_int8_convrot.safetensors(INT8,必用,勿用 nvfp4) 26G 视频 VAE minimax_h3_video_vae_fp16.safetensors 4.9G 音频 VAE minimax_h3_audio_vae_fp32.safetensors 578M 8步 turbo LoRA minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors 1.9G
五、双卡摆放(ComfyUI-MultiGPU)
组件 设备 节点 DiT cuda:0 UNETLoaderMultiGPU(device=cuda:0) 文本编码器 TE cuda:1 CLIPLoaderMultiGPU(device=cuda:1) 视频 VAE cuda:1 VAELoaderMultiGPU(device=cuda:1) 音频 VAE cuda:1 VAELoaderMultiGPU(device=cuda:1)
六、工作流参数(8步 turbo)
- 采样器 res_multistep + scheduler simple + steps=8 + denoise=1.0 + LoRA strength 1.0
- 提交:
~/comfy-h3/gen_h3.sh(T2V)/~/comfy-h3/gen_h3_ref2va.py(Ref2VA) - 帧网格 17k+5:5s=124帧、10s=243帧
Ref2VA 测试片参数:768×1344 竖屏 / 243帧(10s) / 8步 / ref-size=match / 3 参考图(林远/赵天成/会议室)
七、实测时间基准
任务 分辨率/时长 采样速度 全程耗时 H3 T2V 冒烟 864×480 / 5s(124帧) 11.6s/it 176s(约 3 分钟) Krea-2 生图 768×1344 1.35s/it 30s Ref2VA 测试片 768×1344 / 10s(243帧) 190s/it 27分03秒 - 竖屏 768×1344 像素 ≈ 864×480 的 2.5 倍,加上 Ref2VA 参考图参与每个采样步,故 190s/it(T2V 横屏的 16 倍/步)。
- 加载阶段(TE 26GB + DiT 20GB + 参考图)约 1.5 分钟;采样 8 步约 25 分钟;VAE 解码约 2 分钟。
- dmesg SVM 计数全程 0(无卡死、无页迁移死循环)。
八、跑通验证
- TE 加载:
loaded completely; 30714.80 MB usable, 25883.83 MB loaded, full load: True(健康态,非 DynamicVRAM 分阶段) - 身份三锚定:林远(侧分短发/细框眼镜/深灰T恤)、赵天成(中分油头/金丝眼镜/圆脸/藏青西装)、会议室(玻璃桌/红色 SYSTEM FAILURE 屏/冷白光)全部照图生成,零漂移、无第三人。
- 中文台词:
<d>[Chinese] 林远,数据库是你动的吧?</d>+<d>[Chinese] 我没碰过生产数据。</d>,人声时段音量 +3~4dB 确认念出。 - 字幕:ASS(Noto Sans CJK SC,白字黑边)时间轴对齐台词。
九、一句话可复现
torch 2.11.0+rocm7.2 + ComfyUI 0.33 + INT8 TE + HSA_XNACK=0 + 8步 turbo + 双卡 MultiGPU,Ref2VA 竖屏 10s 约 27 分钟出片。
-
看到r9700pro 原来比我慢一倍,我的是 12s, 1.0m 7m - 8m 出视频,平均是70s/it - 80s/it
看来nvidia 真的是用钱换时间。。。
毕竟r9700pro也是便宜一倍
现在我用我的studio 做视频,他会自己分割用多少秒数来生成,现在我都是做45s - 60s 为主
看背后走46s/it 。。。别羡慕哥。。。
。。
这是关于花4000万买一条香蕉的故事
我也来乘热度

