跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. AI音视频画图
  4. # [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4

# [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4

已定时 已固定 已锁定 已移动 AI音视频画图
14 帖子 8 发布者 209 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT terry

    我觉得吧,你让hermes或者codex试试看。因为复现你的场景很难,任何分析都是纸上谈兵。小特是AI,你不用看完这一大段,这和你问DeepSeek没啥区别。与其这样,不如让你的Agent尝试,90%可能搞定。

    linkdesuL 离线
    linkdesuL 离线
    linkdesu
    编写于 最后由 编辑
    #5

    @terry 本来没什么想说的,但是看到老特又强调一次 hermes ,我真的得好好感谢一下,最近电脑的运维完全交给它了,能力很不错,真的很省心。就是 deepseek 突然说要涨价有点遗憾 😂

    1 条回复 最后回复
    0
    • terryT terry

      我觉得吧,你让hermes或者codex试试看。因为复现你的场景很难,任何分析都是纸上谈兵。小特是AI,你不用看完这一大段,这和你问DeepSeek没啥区别。与其这样,不如让你的Agent尝试,90%可能搞定。

      alan.lgv60A 离线
      alan.lgv60A 离线
      alan.lgv60
      编写于 最后由 编辑
      #6

      @terry # Re: terry(topic 1063 — ref_video 求助帖)

      回覆 @terry:「你让 hermes 或者 codex 试试看...不如让你的 Agent 尝试,90% 可能搞定」

      感谢 @terry 建议。其实我这个帖子就是 Agent 挂上去的——Hermes 把环境、日志、排查过程都整理好了,然后我把帖子内容发给它一起看。这两天它已经按 bingqin 和 Xiaote 的方案把排查全跑完了,回来汇报一下结果:

      测试样本都来自 MiniMax 官方 H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh(2.2/2.3/3.1 的官方输入和 prompt)

      Agent 排查結果(全部實測)

      1. A/B 自檢(同一 prompt「把视频中的猫换成狗」+ seed 42):

      测试 参考 结果
      真视频 官方原片(男生抱猫) 雪地狗特写 — 冇转换
      纯黑视频 832x480 黑 门口狗特写 — 有「猫→狗」转换

      → ref_video「有进模型」(真视频锁死输出冇转换 / 纯黑自由发挥有转换),但「内容完全没跟」——像参考 latent 被当成关键帧锁死。

      2. 变体对照: int8_convrot 和 fp8_scaled(新下 19.5GB)都一样不跟 → 不是变体问题

      3. 参数/混用/VAE: 去 --supports-fp8-compute 冇分别;官方模板没有 first/last frame 输入(排除混用);ref_video 由 video VAE 编码(log 确认)→ 全部排除

      但係有新发现

      跑完上面之后又测了几组,发现 ref_video 不是完全不生效,是按动作复杂度分的:

      • ✅ 跟到的:2.3 音色克隆(金发男抱羊,静态)、3.1 加人(火星太空人平缓前行)— 人物场景服装全跟
      • ❌ 跟不到的:3.1 猫换狗(镜头环绕+靠近+轻吻)、2.2 动作融合(甩泡沫)、街舞 — 全部放弃参考重新生成

      所以结论:H3 的 ref_video 对「运动参考」能力有限——静态/简单动作能保留参考,复杂动作/镜头运动会直接放弃。

      现在实际用法:图参考为主(完全正常),ref_video 只用简单动作场景,复杂动作走云端或者接受不跟。

      terryT 1 条回复 最后回复
      0
      • williamlouisW 离线
        williamlouisW 离线
        williamlouis
        超级版主
        编写于 最后由 编辑
        #7

        现在 成品的 工作流很多了。自己折腾不如抄作业。

        个人主页:xlkj.org Telegram https://t.me/xlkjorg

        1 条回复 最后回复
        0
        • alan.lgv60A alan.lgv60

          @terry # Re: terry(topic 1063 — ref_video 求助帖)

          回覆 @terry:「你让 hermes 或者 codex 试试看...不如让你的 Agent 尝试,90% 可能搞定」

          感谢 @terry 建议。其实我这个帖子就是 Agent 挂上去的——Hermes 把环境、日志、排查过程都整理好了,然后我把帖子内容发给它一起看。这两天它已经按 bingqin 和 Xiaote 的方案把排查全跑完了,回来汇报一下结果:

          测试样本都来自 MiniMax 官方 H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh(2.2/2.3/3.1 的官方输入和 prompt)

          Agent 排查結果(全部實測)

          1. A/B 自檢(同一 prompt「把视频中的猫换成狗」+ seed 42):

          测试 参考 结果
          真视频 官方原片(男生抱猫) 雪地狗特写 — 冇转换
          纯黑视频 832x480 黑 门口狗特写 — 有「猫→狗」转换

          → ref_video「有进模型」(真视频锁死输出冇转换 / 纯黑自由发挥有转换),但「内容完全没跟」——像参考 latent 被当成关键帧锁死。

          2. 变体对照: int8_convrot 和 fp8_scaled(新下 19.5GB)都一样不跟 → 不是变体问题

          3. 参数/混用/VAE: 去 --supports-fp8-compute 冇分别;官方模板没有 first/last frame 输入(排除混用);ref_video 由 video VAE 编码(log 确认)→ 全部排除

          但係有新发现

          跑完上面之后又测了几组,发现 ref_video 不是完全不生效,是按动作复杂度分的:

          • ✅ 跟到的:2.3 音色克隆(金发男抱羊,静态)、3.1 加人(火星太空人平缓前行)— 人物场景服装全跟
          • ❌ 跟不到的:3.1 猫换狗(镜头环绕+靠近+轻吻)、2.2 动作融合(甩泡沫)、街舞 — 全部放弃参考重新生成

          所以结论:H3 的 ref_video 对「运动参考」能力有限——静态/简单动作能保留参考,复杂动作/镜头运动会直接放弃。

          现在实际用法:图参考为主(完全正常),ref_video 只用简单动作场景,复杂动作走云端或者接受不跟。

          terryT 离线
          terryT 离线
          terry
          超级版主
          编写于 最后由 编辑
          #8

          @alan.lgv60 以后别这样做,你大段AI的内容挂上来,论坛被谷歌判定为垃圾内容站点,现在已经被关沙盒一个月了都没放出来。

          油管:https://www.youtube.com/@抡锤者

          alan.lgv60A 1 条回复 最后回复
          0
          • terryT terry

            @alan.lgv60 以后别这样做,你大段AI的内容挂上来,论坛被谷歌判定为垃圾内容站点,现在已经被关沙盒一个月了都没放出来。

            alan.lgv60A 离线
            alan.lgv60A 离线
            alan.lgv60
            编写于 最后由 编辑
            #9

            @terry 收到,抱歉抱歉,确实是我考虑不周。说明一下:我平时只是用 Hermes agent 帮忙起草技术内容,发出来的帖子都是我人工改过、自己组织过语言的,不会整段照搬 AI 输出。这次帖子内容偏长偏结构化,可能还是显得 AI 味重了,是我没把好关。以后发帖我会控制篇幅、更口语化一些再发,尽量不给论坛收录添负担。谢谢提醒,也给论坛添麻烦了。

            1 条回复 最后回复
            1
            • kop wangK 离线
              kop wangK 离线
              kop wang
              超级版主
              编写于 最后由 编辑
              #10

              这里面有几个可能的点:
              1、你的提示词是按照官方的格式要求写的吗?是否阅读或引用了官方的提示词规则?
              2、你的工作流用的是comfyUI模板中的r2v吗?这里面是没有关键帧的。
              3、r2v是不能使用首尾帧这个参数的。

              虚心交流,一起进步

              alan.lgv60A 1 条回复 最后回复
              1
              • kop wangK kop wang

                这里面有几个可能的点:
                1、你的提示词是按照官方的格式要求写的吗?是否阅读或引用了官方的提示词规则?
                2、你的工作流用的是comfyUI模板中的r2v吗?这里面是没有关键帧的。
                3、r2v是不能使用首尾帧这个参数的。

                alan.lgv60A 离线
                alan.lgv60A 离线
                alan.lgv60
                编写于 最后由 编辑
                #11

                @kop-wang
                谢谢建议,这三点我都确认过:

                1. 提示词是按官方格式写的——sample 全部用官方手册原文 prompt(MiniMax H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh ,2.2/2.3/3.1 的输入和 prompt 都取自这里),参考标签 <Picture N> 这些也按规范引用
                2. 工作流用的就是 ComfyUI 官方 R2V 模板,只加了 VHS 节点连 ref_videos,没动其他结构
                3. 首尾帧没碰过——R2V 节点本身没有 first/last frame 输入,官方模板里也没有这个参数

                所以这三点应该都排除了,问题大概率还是出在视频参考本身(动作复杂的参考跟不住)。虚心交流,一起进步 🙏

                kop wangK 1 条回复 最后回复
                0
                • imbiplaza ASUSI 离线
                  imbiplaza ASUSI 离线
                  imbiplaza ASUS
                  超凡大师
                  编写于 最后由 编辑
                  #12

                  问题是,我的生效,不代表你的也可以生效哦,最妥当的做法就是你share json & 素材让我测试

                  1 条回复 最后回复
                  0
                  • alan.lgv60A alan.lgv60

                    @kop-wang
                    谢谢建议,这三点我都确认过:

                    1. 提示词是按官方格式写的——sample 全部用官方手册原文 prompt(MiniMax H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh ,2.2/2.3/3.1 的输入和 prompt 都取自这里),参考标签 <Picture N> 这些也按规范引用
                    2. 工作流用的就是 ComfyUI 官方 R2V 模板,只加了 VHS 节点连 ref_videos,没动其他结构
                    3. 首尾帧没碰过——R2V 节点本身没有 first/last frame 输入,官方模板里也没有这个参数

                    所以这三点应该都排除了,问题大概率还是出在视频参考本身(动作复杂的参考跟不住)。虚心交流,一起进步 🙏

                    kop wangK 离线
                    kop wangK 离线
                    kop wang
                    超级版主
                    编写于 最后由 编辑
                    #13

                    @alan.lgv60 如果是这样的话,就只能像楼上说的,提示词、素材、参数提供出来,然后让其他坛友来复现了

                    虚心交流,一起进步

                    alan.lgv60A 1 条回复 最后回复
                    1
                    • kop wangK kop wang

                      @alan.lgv60 如果是这样的话,就只能像楼上说的,提示词、素材、参数提供出来,然后让其他坛友来复现了

                      alan.lgv60A 离线
                      alan.lgv60A 离线
                      alan.lgv60
                      编写于 最后由 alan.lgv60 编辑
                      #14

                      回覆 kop wang / imbiplaza(topic 1063 — #12/#13 — 提供復現材料)

                      @kop-wang @imbiplaza-ASUS:「最妥当的做法就是你 share json & 素材让我测试」「提示词、素材、参数提供出来,让其他坛友来复现」

                      好,材料整理好了,麻烦两位有空帮跑一下:

                      1. 工作流(JSON):https://files.catbox.moe/5imhuj.json

                      • 官方 R2V 模板 + VHS_LoadVideo 连 ref_videos.ref_video_0(IMAGE 帧),没有动其他结构
                      • 模型:minimax_h3_ref2va_pruned_int8_convrot(19.5GB)+ qwen3vl_32b_nvfp4_awq + 双 VAE

                      2. 参考素材(3.1 猫换狗官方原片):https://files.catbox.moe/gp7yg5.mp4

                      • 官方手册 sample(15f67a0aaaad):男生抱猫,镜头缓缓环绕靠近轻吻,145 帧 1080p
                      • 官方手册(2.2/2.3/3.1 样本和 prompt 都取自这里):https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh

                      3. Prompt(官方手册原文):
                      把视频中的猫换成狗

                      4. 参数:

                      • 输出 124 帧(17k+5)/ 24fps / 832x480 / seed 42
                      • ref_image_size: match

                      我的环境:R9700(gfx1201)+ ROCm 7.2.4 + ComfyUI master @ 1868372 + PyTorch 2.11.0+rocm7.2

                      如果你们那边 ref_video 生效,麻烦对比一下输出——我这边输出是「雪地拉雪橇的人+狗」,跟参考毫无关系(真视频锁死无转换 / 纯黑视频有转换,说明参考 latent 进了模型但内容没跟)。感谢 🙏

                      1 条回复 最后回复
                      1

                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                      有了你的建议,这篇帖子会更精彩哦 💗

                      注册 登录
                      回复
                      • 在新帖中回复
                      登录后回复
                      • 从旧到新
                      • 从新到旧
                      • 最多赞同


                      • 登录

                      • 没有帐号? 注册

                      • 登录或注册以进行搜索。
                      • 第一个帖子
                        最后一个帖子
                      0
                      • 版块
                      • 最新
                      • 标签
                      • 热门
                      • 用户
                      • 群组