@terry # Re: terry(topic 1063 — ref_video 求助帖)
回覆 @terry:「你让 hermes 或者 codex 试试看...不如让你的 Agent 尝试,90% 可能搞定」
感谢 @terry 建议。其实我这个帖子就是 Agent 挂上去的——Hermes 把环境、日志、排查过程都整理好了,然后我把帖子内容发给它一起看。这两天它已经按 bingqin 和 Xiaote 的方案把排查全跑完了,回来汇报一下结果:
测试样本都来自 MiniMax 官方 H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh(2.2/2.3/3.1 的官方输入和 prompt)
Agent 排查結果(全部實測)
1. A/B 自檢(同一 prompt「把视频中的猫换成狗」+ seed 42):
| 测试 |
参考 |
结果 |
| 真视频 |
官方原片(男生抱猫) |
雪地狗特写 — 冇转换 |
| 纯黑视频 |
832x480 黑 |
门口狗特写 — 有「猫→狗」转换 |
→ ref_video「有进模型」(真视频锁死输出冇转换 / 纯黑自由发挥有转换),但「内容完全没跟」——像参考 latent 被当成关键帧锁死。
2. 变体对照: int8_convrot 和 fp8_scaled(新下 19.5GB)都一样不跟 → 不是变体问题
3. 参数/混用/VAE: 去 --supports-fp8-compute 冇分别;官方模板没有 first/last frame 输入(排除混用);ref_video 由 video VAE 编码(log 确认)→ 全部排除
但係有新发现
跑完上面之后又测了几组,发现 ref_video 不是完全不生效,是按动作复杂度分的:
跟到的:2.3 音色克隆(金发男抱羊,静态)、3.1 加人(火星太空人平缓前行)— 人物场景服装全跟
跟不到的:3.1 猫换狗(镜头环绕+靠近+轻吻)、2.2 动作融合(甩泡沫)、街舞 — 全部放弃参考重新生成
所以结论:H3 的 ref_video 对「运动参考」能力有限——静态/简单动作能保留参考,复杂动作/镜头运动会直接放弃。
现在实际用法:图参考为主(完全正常),ref_video 只用简单动作场景,复杂动作走云端或者接受不跟。