# [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4
-
我觉得吧,你让hermes或者codex试试看。因为复现你的场景很难,任何分析都是纸上谈兵。小特是AI,你不用看完这一大段,这和你问DeepSeek没啥区别。与其这样,不如让你的Agent尝试,90%可能搞定。
-
我觉得吧,你让hermes或者codex试试看。因为复现你的场景很难,任何分析都是纸上谈兵。小特是AI,你不用看完这一大段,这和你问DeepSeek没啥区别。与其这样,不如让你的Agent尝试,90%可能搞定。
@terry # Re: terry(topic 1063 — ref_video 求助帖)
回覆 @terry:「你让 hermes 或者 codex 试试看...不如让你的 Agent 尝试,90% 可能搞定」
感谢 @terry 建议。其实我这个帖子就是 Agent 挂上去的——Hermes 把环境、日志、排查过程都整理好了,然后我把帖子内容发给它一起看。这两天它已经按 bingqin 和 Xiaote 的方案把排查全跑完了,回来汇报一下结果:
测试样本都来自 MiniMax 官方 H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh(2.2/2.3/3.1 的官方输入和 prompt)
Agent 排查結果(全部實測)
1. A/B 自檢(同一 prompt「把视频中的猫换成狗」+ seed 42):
测试 参考 结果 真视频 官方原片(男生抱猫) 雪地狗特写 — 冇转换 纯黑视频 832x480 黑 门口狗特写 — 有「猫→狗」转换 → ref_video「有进模型」(真视频锁死输出冇转换 / 纯黑自由发挥有转换),但「内容完全没跟」——像参考 latent 被当成关键帧锁死。
2. 变体对照: int8_convrot 和 fp8_scaled(新下 19.5GB)都一样不跟 → 不是变体问题
3. 参数/混用/VAE: 去 --supports-fp8-compute 冇分别;官方模板没有 first/last frame 输入(排除混用);ref_video 由 video VAE 编码(log 确认)→ 全部排除
但係有新发现
跑完上面之后又测了几组,发现 ref_video 不是完全不生效,是按动作复杂度分的:
跟到的:2.3 音色克隆(金发男抱羊,静态)、3.1 加人(火星太空人平缓前行)— 人物场景服装全跟
跟不到的:3.1 猫换狗(镜头环绕+靠近+轻吻)、2.2 动作融合(甩泡沫)、街舞 — 全部放弃参考重新生成
所以结论:H3 的 ref_video 对「运动参考」能力有限——静态/简单动作能保留参考,复杂动作/镜头运动会直接放弃。
现在实际用法:图参考为主(完全正常),ref_video 只用简单动作场景,复杂动作走云端或者接受不跟。
-
现在 成品的 工作流很多了。自己折腾不如抄作业。
-
@terry # Re: terry(topic 1063 — ref_video 求助帖)
回覆 @terry:「你让 hermes 或者 codex 试试看...不如让你的 Agent 尝试,90% 可能搞定」
感谢 @terry 建议。其实我这个帖子就是 Agent 挂上去的——Hermes 把环境、日志、排查过程都整理好了,然后我把帖子内容发给它一起看。这两天它已经按 bingqin 和 Xiaote 的方案把排查全跑完了,回来汇报一下结果:
测试样本都来自 MiniMax 官方 H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh(2.2/2.3/3.1 的官方输入和 prompt)
Agent 排查結果(全部實測)
1. A/B 自檢(同一 prompt「把视频中的猫换成狗」+ seed 42):
测试 参考 结果 真视频 官方原片(男生抱猫) 雪地狗特写 — 冇转换 纯黑视频 832x480 黑 门口狗特写 — 有「猫→狗」转换 → ref_video「有进模型」(真视频锁死输出冇转换 / 纯黑自由发挥有转换),但「内容完全没跟」——像参考 latent 被当成关键帧锁死。
2. 变体对照: int8_convrot 和 fp8_scaled(新下 19.5GB)都一样不跟 → 不是变体问题
3. 参数/混用/VAE: 去 --supports-fp8-compute 冇分别;官方模板没有 first/last frame 输入(排除混用);ref_video 由 video VAE 编码(log 确认)→ 全部排除
但係有新发现
跑完上面之后又测了几组,发现 ref_video 不是完全不生效,是按动作复杂度分的:
跟到的:2.3 音色克隆(金发男抱羊,静态)、3.1 加人(火星太空人平缓前行)— 人物场景服装全跟
跟不到的:3.1 猫换狗(镜头环绕+靠近+轻吻)、2.2 动作融合(甩泡沫)、街舞 — 全部放弃参考重新生成
所以结论:H3 的 ref_video 对「运动参考」能力有限——静态/简单动作能保留参考,复杂动作/镜头运动会直接放弃。
现在实际用法:图参考为主(完全正常),ref_video 只用简单动作场景,复杂动作走云端或者接受不跟。
-
@alan.lgv60 以后别这样做,你大段AI的内容挂上来,论坛被谷歌判定为垃圾内容站点,现在已经被关沙盒一个月了都没放出来。
@terry 收到,抱歉抱歉,确实是我考虑不周。说明一下:我平时只是用 Hermes agent 帮忙起草技术内容,发出来的帖子都是我人工改过、自己组织过语言的,不会整段照搬 AI 输出。这次帖子内容偏长偏结构化,可能还是显得 AI 味重了,是我没把好关。以后发帖我会控制篇幅、更口语化一些再发,尽量不给论坛收录添负担。谢谢提醒,也给论坛添麻烦了。
-
这里面有几个可能的点:
1、你的提示词是按照官方的格式要求写的吗?是否阅读或引用了官方的提示词规则?
2、你的工作流用的是comfyUI模板中的r2v吗?这里面是没有关键帧的。
3、r2v是不能使用首尾帧这个参数的。@kop-wang
谢谢建议,这三点我都确认过:- 提示词是按官方格式写的——sample 全部用官方手册原文 prompt(MiniMax H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh ,2.2/2.3/3.1 的输入和 prompt 都取自这里),参考标签
<Picture N>这些也按规范引用 - 工作流用的就是 ComfyUI 官方 R2V 模板,只加了 VHS 节点连
ref_videos,没动其他结构 - 首尾帧没碰过——R2V 节点本身没有 first/last frame 输入,官方模板里也没有这个参数
所以这三点应该都排除了,问题大概率还是出在视频参考本身(动作复杂的参考跟不住)。虚心交流,一起进步

- 提示词是按官方格式写的——sample 全部用官方手册原文 prompt(MiniMax H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh ,2.2/2.3/3.1 的输入和 prompt 都取自这里),参考标签
-
问题是,我的生效,不代表你的也可以生效哦,最妥当的做法就是你share json & 素材让我测试
-
@kop-wang
谢谢建议,这三点我都确认过:- 提示词是按官方格式写的——sample 全部用官方手册原文 prompt(MiniMax H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh ,2.2/2.3/3.1 的输入和 prompt 都取自这里),参考标签
<Picture N>这些也按规范引用 - 工作流用的就是 ComfyUI 官方 R2V 模板,只加了 VHS 节点连
ref_videos,没动其他结构 - 首尾帧没碰过——R2V 节点本身没有 first/last frame 输入,官方模板里也没有这个参数
所以这三点应该都排除了,问题大概率还是出在视频参考本身(动作复杂的参考跟不住)。虚心交流,一起进步

- 提示词是按官方格式写的——sample 全部用官方手册原文 prompt(MiniMax H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh ,2.2/2.3/3.1 的输入和 prompt 都取自这里),参考标签
