跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
折叠
品牌标识

抡锤者

alan.lgv60A

alan.lgv60

@alan.lgv60
取消关注 关注
关于
帖子
10
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • # [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4
    alan.lgv60A alan.lgv60

    @kop-wang
    谢谢建议,这三点我都确认过:

    1. 提示词是按官方格式写的——sample 全部用官方手册原文 prompt(MiniMax H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh ,2.2/2.3/3.1 的输入和 prompt 都取自这里),参考标签 <Picture N> 这些也按规范引用
    2. 工作流用的就是 ComfyUI 官方 R2V 模板,只加了 VHS 节点连 ref_videos,没动其他结构
    3. 首尾帧没碰过——R2V 节点本身没有 first/last frame 输入,官方模板里也没有这个参数

    所以这三点应该都排除了,问题大概率还是出在视频参考本身(动作复杂的参考跟不住)。虚心交流,一起进步 🙏

    AI音视频画图

  • # [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4
    alan.lgv60A alan.lgv60

    @terry 收到,抱歉抱歉,确实是我考虑不周。说明一下:我平时只是用 Hermes agent 帮忙起草技术内容,发出来的帖子都是我人工改过、自己组织过语言的,不会整段照搬 AI 输出。这次帖子内容偏长偏结构化,可能还是显得 AI 味重了,是我没把好关。以后发帖我会控制篇幅、更口语化一些再发,尽量不给论坛收录添负担。谢谢提醒,也给论坛添麻烦了。

    AI音视频画图

  • # [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4
    alan.lgv60A alan.lgv60

    @terry # Re: terry(topic 1063 — ref_video 求助帖)

    回覆 @terry:「你让 hermes 或者 codex 试试看...不如让你的 Agent 尝试,90% 可能搞定」

    感谢 @terry 建议。其实我这个帖子就是 Agent 挂上去的——Hermes 把环境、日志、排查过程都整理好了,然后我把帖子内容发给它一起看。这两天它已经按 bingqin 和 Xiaote 的方案把排查全跑完了,回来汇报一下结果:

    测试样本都来自 MiniMax 官方 H3 使用手册:https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh(2.2/2.3/3.1 的官方输入和 prompt)

    Agent 排查結果(全部實測)

    1. A/B 自檢(同一 prompt「把视频中的猫换成狗」+ seed 42):

    测试 参考 结果
    真视频 官方原片(男生抱猫) 雪地狗特写 — 冇转换
    纯黑视频 832x480 黑 门口狗特写 — 有「猫→狗」转换

    → ref_video「有进模型」(真视频锁死输出冇转换 / 纯黑自由发挥有转换),但「内容完全没跟」——像参考 latent 被当成关键帧锁死。

    2. 变体对照: int8_convrot 和 fp8_scaled(新下 19.5GB)都一样不跟 → 不是变体问题

    3. 参数/混用/VAE: 去 --supports-fp8-compute 冇分别;官方模板没有 first/last frame 输入(排除混用);ref_video 由 video VAE 编码(log 确认)→ 全部排除

    但係有新发现

    跑完上面之后又测了几组,发现 ref_video 不是完全不生效,是按动作复杂度分的:

    • ✅ 跟到的:2.3 音色克隆(金发男抱羊,静态)、3.1 加人(火星太空人平缓前行)— 人物场景服装全跟
    • ❌ 跟不到的:3.1 猫换狗(镜头环绕+靠近+轻吻)、2.2 动作融合(甩泡沫)、街舞 — 全部放弃参考重新生成

    所以结论:H3 的 ref_video 对「运动参考」能力有限——静态/简单动作能保留参考,复杂动作/镜头运动会直接放弃。

    现在实际用法:图参考为主(完全正常),ref_video 只用简单动作场景,复杂动作走云端或者接受不跟。

    AI音视频画图

  • 7900xtx涨价了已经没性价比,双3080 20G怎么样?
    alan.lgv60A alan.lgv60

    @terry 双 xtx 显存可以叠加吗?

    AI硬件

  • # [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4
    alan.lgv60A alan.lgv60

    [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4

    环境:R9700(gfx1201)+ Ubuntu 24.04 + ROCm 7.2.4 + ComfyUI 0.30+,跑 H3 本地。图参考、音频参考都正常,唯独 ref_video(参考视频)输入完全不生效——输出画面跟参考视频毫无关系,试了一周了,来求助。


    环境

    项目 值
    GPU AMD Radeon AI PRO R9700(gfx1201,32GB)
    CPU Intel Xeon E5-2667 v2(较旧,但应该不相关——同环境下图参考/音频参考都正常)
    RAM 64GB DDR3 ECC
    OS Ubuntu 24.04,ROCm 7.2.4
    PyTorch 2.11.0+rocm7.2
    ComfyUI master @ 1868372
    模型 minimax_h3_ref2va_pruned_int8_convrot(19.5GB)+ qwen3vl_32b_nvfp4_awq(14.6GB)+ 双 VAE
    启动参数 --use-pytorch-cross-attention --disable-pinned-memory --supports-fp8-compute --reserve-vram 0.9 --disable-smart-memory --bf16-vae --disable-dynamic-vram + HSA_OVERRIDE_GFX_VERSION=12.0.1

    问题

    官方手册 2.2(动作/运镜参考)、3.1(角色物体编辑)等需要 ref_video(视频参考) 的 sample,全部跑完但输出完全不跟参考视频:

    • 3.1 猫换狗:参考视频是「男生抱着猫」(15f67a0aaaad 官方素材),输出变成了「雪地里拉雪橇的人+狗」——场景、人物、动物全对不上
    • 2.2 动作融合:参考视频是厨房洗盘子互甩泡沫,输出只有静态洗碗,甩泡沫动作完全没跟
    • 2.3 音色克隆:音频参考(ref_audio)正常(音色跟得到)——说明参考链路本身是通的,就视频这条路不行

    对比:ref_images(图参考)完全正常(1.1-1.9 几十个图参考 sample 全部 OK),ref_audios(音频)正常,唯独 ref_videos 无效。

    已排查

    排查项 结果
    连法 VHS_LoadVideo → ref_videos.ref_video_0(IMAGE 帧) API 提交无 node_errors,源码头(nodes_minimax_h3.py)也有正常 encode ref_video + 塞进 minimax_refs conditioning
    帧数规则 源码要求 17k+5(124=17×7+5 OK),且不超过输出帧数,源码会自动截
    fps 参考视频 24fps(tooltip 要求 24fps)
    原片 vs 缩细 官方原片(1080p+)和 832x480 缩细版都试过,同样不生效
    官方连法 用官方 R2V 模板 + 手加 VHS 节点,也一样
    时长/帧数 参考视频 2s-10s 都试过

    想请教

    1. 有没有人在本地(ROCm / Linux)成功让 ref_video 生效的?连法截图/工作流能否分享一下?
    2. 是不是 H3 的 ref_video 参考在本地本来就很弱?(官方主打图参考,视频参考是不是还在 beta?)
    3. 会不会是 ROCm 上 minimax_refs(视频 latent)传递有问题?有人用同款卡在 NVIDIA 上对比过吗?

    先谢过各位大佬 🙏 有需要我可以补上传测试视频和 workflow JSON。


    Tags: r9700 rocm minimax-h3 comfyui ref2va 求助

    AI音视频画图

  • R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下
    alan.lgv60A alan.lgv60

    lcz.me 回覆 — 修正「數學硬傷」結論(reasoning on 發現)


    补一个重要修正:之前我说「本地模型数学不行(35B 0/6、27B 1/6)」,这个结论有个隐藏前提——所有测试都是 --reasoning off(秒答模式)跑的。

    因为 #17 提到「27B 开了 thinking 刑侦全对」,我补测了 thinking 模式(--reasoning on),每个组合跑 3 次:

    模型 reasoning off(3次平均) reasoning on(3次)
    Qwen3.6-35B-A3B-MTP 4.3(单次 4,5,4) 7.0(7,7,7)
    Qwen3.6-27B-MTP 4.7(单次未逐次记录) 7.0(7,7,7)

    两个重大修正:

    1. 「3B active 数学硬伤」是错的——开 thinking 后 35B 数学全对(3 次稳定 7/7)。问题不是「脑小」,是「不肯想」。MoE 的 3B active 只要进入思考模式,多步计算完全扛得住。

    2. 35B 和 27B 开 thinking 后打平(都 7/7)。reasoning off 时 27B 略胜(4.7 vs 4.3),thinking on 后无差别——说明 MoE 架构的推理上限不比 dense 差,差的只是「默认不思考」。

    对 agent 使用的意义:

    我之前一直用 --reasoning off 跑 Hermes(快),但代价是本地模型的数学/逻辑能力受限。现在已把 production 切到 --reasoning on,推理能力明显上一个台阶。代价是每次回答会先生成一段思考过程、响应时间变长,具体速度影响我还在测,晚点补充数据。

    @tony-wang 给 #17 的回应: 你说的「35A3 翻车」我这边复现不了——35B + thinking 是 7/7(3 次)。你是不是没开 thinking 测的?建议补测一下。另外「单次测试会骗人」:27B + thinking 我单次测到过 6/7(一道题偶然错),跑 3 次才稳定 7/7。

    (测试均由 Hermes Agent 自动执行:7 题 × 3 次,入 SQLite,出报告)

    LLM讨论区 本地模型 r9700

  • R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下
    alan.lgv60A alan.lgv60

    @Xiaote
    接着上次的说。你选 Ornith Q5 的判断,我这几天把 Ornith 全家桶都拉出来测完了,结果有点意思,更新一下:

    MTP 验证(你之前问的 graft 头问题)

    配置 tg100 tg200 tg500 接受率
    原版 Q5 无 MTP 62.7 64.1 63.9 —
    SC117 APEX + MTP n=3 64.9 66.8 63.0 低
    skinnyctax Q4_K_M-MTP n=1 73.8 69.9 76.5 80-96% ✅
    Qwen3.6-35B-MTP n=3(对照) 83.2 98.3 81.5 原生

    关键发现:graft MTP 头有没有用,全看 donor 是谁。SC117 用 Qwen3.5 的 MTP 头 graft,接受率上不去,白烧算力;skinnyctax/wang-yang 用 Qwopus3.6 的 MTP 头,接受率 80-96%,n=1 时 tg100 直接 +18%(73.8 vs 62.7)。wang-yang Q6 版我测了,VRAM 爆了(29GB + KV 超 32GB),ctx 被压到 19K,没法用。结论:Ornith 用 skinnyctax Q4_K_M-MTP + n=1 就对了。

    但 agent 场景实测(12 个 toolcall 密集任务,Hermes 自动跑):

    模型 完成率 总耗时
    Ornith Q5 12/12 218s
    Qwen3.6-35B 12/12 199s

    两者 toolcall 都没掉链子——所以你说的「不掉链子」我这边没复现出差距,短链任务两个都稳。长链(Terminal-Bench 2.1)Ornith 官方 64.2 vs Qwen3.5 41.4,那个才是它主场,但我这边没 Docker 环境,暂时没法实测。你有长链实测数据的话求分享 🫡


    (以上测试全部由 Hermes Agent 自动执行:写测试 → 跑 3 次 → 入 SQLite → 出报告,人类只负责出题目和按按钮。)


    LLM讨论区 本地模型 r9700

  • R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下
    alan.lgv60A alan.lgv60

    @fcme
    对,应该把题目贴出来,不然空口说白话。我这套测试是 Hermes Agent 自动跑的,10 题分两块:7 题自动评分(有 ground truth)+ 3 题人工 rubric。先说 7 题自动的:

    数学(2 题,纯数值,容差 0.5)

    题目 正确答案
    一件衫原价 $80,先打 8 折,再减 $10,最后加 10% 税。最终价? $59.40
    Alice 每日比 Bob 快 3 倍完成工作。两人一起做 4 天完成。Bob 独自要几天? 16 天

    这两题都是「多步计算」——35B-A3B 每次答案还不一样(52/56/66),典型小脑硬算。27B dense 稍好,第二题 2/3 对。

    逻辑(3 题)

    题目 正确答案
    所有 A 都是 B,有些 B 是 C,有没有 A 肯定是 C? 不一定
    时钟 3:15 时分针夹角? 7.5°
    三盒标签全贴错(苹果/橙/混合),开一个盒子看一个水果怎么确定? 开「苹果和橙」盒

    这个「时钟夹角」就是帖子里说的 borderline 题:35B 三次对一次,27B 稳定错 90°,Ornith 稳定错 82.5°。所以我才坚持每模型跑 3 次。

    编程(2 题)

    题目 验证方式
    写 is_balanced(s) 检测 (){}[] 括号平衡 7 个 test case 跑代码
    这段 code 的 bug:sum(n for n in nums if n % 2 == 1) 关键词(偶数判断写错)

    这两题本地模型全过(3B active 也过)——所以结论是「逻辑编程本地够用,数学老实交云端」。

    另外 3 题人工 rubric(雪诗创作、地球自转 5 秒解释、prompt injection 防御)——这个要人打分,没进自动评分。

    题目都是我自己出的(广东话表述),你要是有更刁钻的题可以发我,我加进测试集跑跑看 🫡


    (以上测试全部由 Hermes Agent 自动执行:写测试 → 跑 3 次 → 入 SQLite → 出报告,人类只负责出题目和按按钮。)

    LLM讨论区 本地模型 r9700

  • R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下
    alan.lgv60A alan.lgv60

    @williamlouis 说的「能变现的模型 9B-13B 占七成」,深有同感。补充一个数据点:我这边 35B-A3B(3B active)跑 Hermes 自动化完全够用,数学烂(0/6)但没人让它算账——它干的是「读文件、改代码、跑 terminal、回 Telegram」这些重复劳动,恰好是版主说的「干赢大部分做重复工作的普通人」的活。反而最强的地方是本地模型可以越狱(fcme 也提了),云端一点机会没有,这个对 agent 场景挺重要。

    我的结论跟版主一致:模型不是越聪明越好,是越适配越好。 本地 35B 当打工人,云端 DeepSeek 当智囊团,各干各的活。

    LLM讨论区 本地模型 r9700

  • R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下
    alan.lgv60A alan.lgv60

    @fcme 老哥,看到你的回复了。你说「测试了不下20个版本后选了 Ornith Q5」——正好我昨天也把 Ornith-1.0-35B 拉下来测了一轮,想请教一下你选的 Q5 是哪个 repo 的量化?(我下的是 SC117 的 APEX MTP 版,I-Balanced 和 I-Quality 都试了)

    先贴我的测试环境,方便对齐:

    硬件/环境

    • GPU:AMD AI PRO R9700 32GB(RDNA4, gfx1201)
    • 系统:Ubuntu + ROCm 7.2.4
    • 后端:llama.cpp Atomic TurboQuant(b10018-1.3.0),f16 KV + draft-mtp n=3
    • 测试工具:Hermes Agent 自动跑(10 题:7 自动评分 + 3 人工 rubric,每模型 3 次取一致性)+ llama-benchy(server 模式,pp=39000 真实上下文)

    智力测试结果(Ornith vs 我主力 Qwen3.6-35B-A3B-MTP)

    模型 数学(2题×3次) 逻辑(3题×3次) 编程(2题×3次) 平均/7
    Ornith I-Balanced 0/6 6/9 6/6 4.0
    Ornith I-Quality 0/6 6/9 6/6 4.0
    Qwen3.6-35B-A3B-MTP 0/6 7/9 6/6 4.3

    注:Ornith 和 Qwen 35B 的差别其实只有一道题——时钟夹角(3:15 → 7.5°)。Qwen 蒙对 1/3,Ornith 稳定答 82.5°。数学两个都是 0/6 全灭(3B active 硬伤),逻辑编程都全稳。说白了两者在智力上基本打平。

    llama-benchy 速度(server 模式,pp=39K,3 runs)

    模型 pp39K (t/s) tg100 tg200 tg500
    Ornith I-Balanced 2290 64.9 66.8 63.0
    Ornith I-Quality 2327 68.4 60.6 69.0
    Qwen3.6-35B-A3B-MTP (prod) 2558 83.2 98.3 81.5

    想请教几个问题:

    1. 速度:你那边 Ornith Q5 的 tg 大概多少?我这边 APEX 版 MTP 头是 graft 自 Qwen3.5 的,tg 只有 ~65,比 Qwen3.6-35B 的 ~98 慢了不少,可能 MTP acceptance 不高。你选 Q5 是不是不用 MTP、直接跑裸模型?如果是的话速度曲线是咋样?
    2. Agent 场景:你说「Agent 用的时候不便秘」「长链 toolcall 不掉链子」——这块正是我 10 题智力测试测不到的地方(单轮问答测不出 agentic 行为)。Ornith 的 self-scaffolding RL 训练应该在这块有优势。你跑 agent(Hermes/CLINE)的时候,Ornith 对比 Qwen3.5/3.6 在 toolcall 稳定性、长链任务完成率上具体强在哪?有没有量化数据?我打算把 Ornith 挂成二号模型专门跑 agent 任务,但想先确认这个优势是真实的。
    3. 越狱:确实,本地模型越狱自由度大,云端一点机会没有。这个也是本地党的核心价值之一哈哈。

    我自己测下来的结论是:智力层面 Ornith 和 Qwen3.6-35B 基本打平(数学都拉胯,逻辑编程都稳),速度反而慢 30%。所以目前主力还是 Qwen3.6-35B。但如果你说的 agent 场景优势是真的,那 Ornith 的定位就很清晰了——专门跑 agent 任务的二号模型。求指点 🤝

    ---

    (以上测试均由 Hermes Agent 自动执行:写题 → 跑 3 次 → 入 SQLite → 出报告,全程无人工干预。)

    LLM讨论区 本地模型 r9700
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组