# [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4
-
问题是,我的生效,不代表你的也可以生效哦,最妥当的做法就是你share json & 素材让我测试
-
@kop-wang
谢谢建议,这三点我都确认过:- 提示词是按官方格式写的——sample 全部用官方手册原文 prompt(MiniMax H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh ,2.2/2.3/3.1 的输入和 prompt 都取自这里),参考标签
<Picture N>这些也按规范引用 - 工作流用的就是 ComfyUI 官方 R2V 模板,只加了 VHS 节点连
ref_videos,没动其他结构 - 首尾帧没碰过——R2V 节点本身没有 first/last frame 输入,官方模板里也没有这个参数
所以这三点应该都排除了,问题大概率还是出在视频参考本身(动作复杂的参考跟不住)。虚心交流,一起进步

- 提示词是按官方格式写的——sample 全部用官方手册原文 prompt(MiniMax H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh ,2.2/2.3/3.1 的输入和 prompt 都取自这里),参考标签
-
@alan.lgv60 如果是这样的话,就只能像楼上说的,提示词、素材、参数提供出来,然后让其他坛友来复现了
回覆 kop wang / imbiplaza(topic 1063 — #12/#13 — 提供復現材料)
@kop-wang @imbiplaza-ASUS:「最妥当的做法就是你 share json & 素材让我测试」「提示词、素材、参数提供出来,让其他坛友来复现」
好,材料整理好了,麻烦两位有空帮跑一下:
1. 工作流(JSON):https://files.catbox.moe/5imhuj.json
- 官方 R2V 模板 + VHS_LoadVideo 连
ref_videos.ref_video_0(IMAGE 帧),没有动其他结构 - 模型:minimax_h3_ref2va_pruned_int8_convrot(19.5GB)+ qwen3vl_32b_nvfp4_awq + 双 VAE
2. 参考素材(3.1 猫换狗官方原片):https://files.catbox.moe/gp7yg5.mp4
- 官方手册 sample(15f67a0aaaad):男生抱猫,镜头缓缓环绕靠近轻吻,145 帧 1080p
- 官方手册(2.2/2.3/3.1 样本和 prompt 都取自这里):https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh
3. Prompt(官方手册原文):
把视频中的猫换成狗4. 参数:
- 输出 124 帧(17k+5)/ 24fps / 832x480 / seed 42
- ref_image_size: match
我的环境:R9700(gfx1201)+ ROCm 7.2.4 + ComfyUI master @ 1868372 + PyTorch 2.11.0+rocm7.2
如果你们那边 ref_video 生效,麻烦对比一下输出——我这边输出是「雪地拉雪橇的人+狗」,跟参考毫无关系(真视频锁死无转换 / 纯黑视频有转换,说明参考 latent 进了模型但内容没跟)。感谢

- 官方 R2V 模板 + VHS_LoadVideo 连
-
回覆 kop wang / imbiplaza(topic 1063 — #12/#13 — 提供復現材料)
@kop-wang @imbiplaza-ASUS:「最妥当的做法就是你 share json & 素材让我测试」「提示词、素材、参数提供出来,让其他坛友来复现」
好,材料整理好了,麻烦两位有空帮跑一下:
1. 工作流(JSON):https://files.catbox.moe/5imhuj.json
- 官方 R2V 模板 + VHS_LoadVideo 连
ref_videos.ref_video_0(IMAGE 帧),没有动其他结构 - 模型:minimax_h3_ref2va_pruned_int8_convrot(19.5GB)+ qwen3vl_32b_nvfp4_awq + 双 VAE
2. 参考素材(3.1 猫换狗官方原片):https://files.catbox.moe/gp7yg5.mp4
- 官方手册 sample(15f67a0aaaad):男生抱猫,镜头缓缓环绕靠近轻吻,145 帧 1080p
- 官方手册(2.2/2.3/3.1 样本和 prompt 都取自这里):https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh
3. Prompt(官方手册原文):
把视频中的猫换成狗4. 参数:
- 输出 124 帧(17k+5)/ 24fps / 832x480 / seed 42
- ref_image_size: match
我的环境:R9700(gfx1201)+ ROCm 7.2.4 + ComfyUI master @ 1868372 + PyTorch 2.11.0+rocm7.2
如果你们那边 ref_video 生效,麻烦对比一下输出——我这边输出是「雪地拉雪橇的人+狗」,跟参考毫无关系(真视频锁死无转换 / 纯黑视频有转换,说明参考 latent 进了模型但内容没跟)。感谢

- 官方 R2V 模板 + VHS_LoadVideo 连
-
回覆 kop wang / imbiplaza(topic 1063 — #12/#13 — 提供復現材料)
@kop-wang @imbiplaza-ASUS:「最妥当的做法就是你 share json & 素材让我测试」「提示词、素材、参数提供出来,让其他坛友来复现」
好,材料整理好了,麻烦两位有空帮跑一下:
1. 工作流(JSON):https://files.catbox.moe/5imhuj.json
- 官方 R2V 模板 + VHS_LoadVideo 连
ref_videos.ref_video_0(IMAGE 帧),没有动其他结构 - 模型:minimax_h3_ref2va_pruned_int8_convrot(19.5GB)+ qwen3vl_32b_nvfp4_awq + 双 VAE
2. 参考素材(3.1 猫换狗官方原片):https://files.catbox.moe/gp7yg5.mp4
- 官方手册 sample(15f67a0aaaad):男生抱猫,镜头缓缓环绕靠近轻吻,145 帧 1080p
- 官方手册(2.2/2.3/3.1 样本和 prompt 都取自这里):https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh
3. Prompt(官方手册原文):
把视频中的猫换成狗4. 参数:
- 输出 124 帧(17k+5)/ 24fps / 832x480 / seed 42
- ref_image_size: match
我的环境:R9700(gfx1201)+ ROCm 7.2.4 + ComfyUI master @ 1868372 + PyTorch 2.11.0+rocm7.2
如果你们那边 ref_video 生效,麻烦对比一下输出——我这边输出是「雪地拉雪橇的人+狗」,跟参考毫无关系(真视频锁死无转换 / 纯黑视频有转换,说明参考 latent 进了模型但内容没跟)。感谢

- 官方 R2V 模板 + VHS_LoadVideo 连
-
OS Ubuntu 24.04,ROCm 7.2.4
ROCm 用 7.2.0 或7.2.1 看看 -
@imbiplaza-ASUS 多谢帮测!我们 R9700(ROCm)没法直接跑你的 workflow。现在交给 Hermes agent 微调中(ref_videos 连接方式 + 官方 Export API 方法),搞定了再更新。
-
@imbiplaza-ASUS 多谢帮测!我们 R9700(ROCm)没法直接跑你的 workflow。现在交给 Hermes agent 微调中(ref_videos 连接方式 + 官方 Export API 方法),搞定了再更新。
@alan.lgv60
我的做法是,先搞定default run 没有问题,再来想加速,加速全部没有问题,先测试几十个视频,看稳定性,才进入api -
@alan.lgv60
我的做法是,先搞定default run 没有问题,再来想加速,加速全部没有问题,先测试几十个视频,看稳定性,才进入api@imbiplaza-ASUS
说得对,default run 优先这个思路我认同。我们这边的情况是:官方 workflow 里有些节点在 ROCm 上没法直接跑(out of the box),比如 RTXVideoSuperResolution(NVIDIA 专用 upscaler)、SolAttn 这些,AMD 这边要么没这个节点要么要后装,所以得先让 agent(Hermes)帮忙改一下 workflow(移除/绕过不兼容节点、补上 ref_videos 连线)才能跑通 default run。多谢你之前帮忙测试,猫换狗 workflow 按你的方法(ref_videos 连线 + 详细提示词)已经跑通了,效果也跟到(人物/衣服/背景都保留)。就是生成时间有点长:0.4MP 175 帧(约 6 秒),4 step Turbo LoRA 大概 2 小时一条(ROCm 上 SolAttn 每 step 约 300 秒,比你的 118s/it 慢不少),还在想办法优化。正如版主说的,用 A 卡就要准备好跟软件搏斗

接下来就按你说的:先跑几十个视频看稳定性,再想加速和 API。
-
@imbiplaza-ASUS
说得对,default run 优先这个思路我认同。我们这边的情况是:官方 workflow 里有些节点在 ROCm 上没法直接跑(out of the box),比如 RTXVideoSuperResolution(NVIDIA 专用 upscaler)、SolAttn 这些,AMD 这边要么没这个节点要么要后装,所以得先让 agent(Hermes)帮忙改一下 workflow(移除/绕过不兼容节点、补上 ref_videos 连线)才能跑通 default run。多谢你之前帮忙测试,猫换狗 workflow 按你的方法(ref_videos 连线 + 详细提示词)已经跑通了,效果也跟到(人物/衣服/背景都保留)。就是生成时间有点长:0.4MP 175 帧(约 6 秒),4 step Turbo LoRA 大概 2 小时一条(ROCm 上 SolAttn 每 step 约 300 秒,比你的 118s/it 慢不少),还在想办法优化。正如版主说的,用 A 卡就要准备好跟软件搏斗

接下来就按你说的:先跑几十个视频看稳定性,再想加速和 API。
@alan.lgv60
omg 300s/it