H3,WAN 2.2, LTX 2.3在Pro 6000+128GB下怎么选
-
我现在已经做了差不多3-6分钟左右的视频,说实话,视频的质量不让我满意。
现在视频都是H3做出来的。H3好处是可以直接配音乐和对口型做出来。但是感觉质量不行。和WAN2.2的模型比起来。WAN2.2完爆H3。
因为我现在的显存够大。我更在乎做出来的视频模型质量。这种情况下,应该选哪个模型?好多人说LTX2.3有最多的私人设置好的链路 这样我就可以直接使用,并且大批量使用我也能接受。
请各位大神给点意见。
视频稍后发上来,我需要花点时间看看怎么上传。你的约束是「显存够大 + 只要成片质量」,那结论不是三选一,而是按镜头类型分工:
- WAN2.2:质量上限最高,Lora/Control 生态最成熟,适合人物替换、大动态、多 Lora 叠加。代价是官方没有原生音画同步,音频/对口型要另接管线(MMAudio + 口型模型)。你说「完爆 H3」,在同参数同 Lora 下基本成立。
- H3:强项是一体化的音频+对口型+人物一致性,出片快;弱项是 base 分辨率偏低、官方 Lora 支持少,所以长片/大动态容易露怯。适合口播、对白、单人一致性镜头。
- LTX2.3:快,适合批量出草稿和迭代构图;但时序逻辑、穿模、细节弱一档,不建议当最终成片主力。所谓「私人链路多」本质就是别人调好的 ComfyUI workflow,ltx.io 和 Civitai 上能直接抄。
Pro 6000 96G + 128G 的真正瓶颈不是显存,是「单次时长」。现在没有模型能一次生成 3–6 分钟连贯视频(多数 5–10 秒一段)。所以按镜头切分:关键镜头 WAN2.2 高分辨率 + Lora(两阶段采样,别开低比特量化),口播/对白镜头 H3,LTX2.3 只做草稿;跨镜头用首尾帧接力保一致性,最后插帧+超分。
先定「这条片子是口播还是剧情」,模型就不用纠结了。
-
你的约束是「显存够大 + 只要成片质量」,那结论不是三选一,而是按镜头类型分工:
- WAN2.2:质量上限最高,Lora/Control 生态最成熟,适合人物替换、大动态、多 Lora 叠加。代价是官方没有原生音画同步,音频/对口型要另接管线(MMAudio + 口型模型)。你说「完爆 H3」,在同参数同 Lora 下基本成立。
- H3:强项是一体化的音频+对口型+人物一致性,出片快;弱项是 base 分辨率偏低、官方 Lora 支持少,所以长片/大动态容易露怯。适合口播、对白、单人一致性镜头。
- LTX2.3:快,适合批量出草稿和迭代构图;但时序逻辑、穿模、细节弱一档,不建议当最终成片主力。所谓「私人链路多」本质就是别人调好的 ComfyUI workflow,ltx.io 和 Civitai 上能直接抄。
Pro 6000 96G + 128G 的真正瓶颈不是显存,是「单次时长」。现在没有模型能一次生成 3–6 分钟连贯视频(多数 5–10 秒一段)。所以按镜头切分:关键镜头 WAN2.2 高分辨率 + Lora(两阶段采样,别开低比特量化),口播/对白镜头 H3,LTX2.3 只做草稿;跨镜头用首尾帧接力保一致性,最后插帧+超分。
先定「这条片子是口播还是剧情」,模型就不用纠结了。
-
"但是感觉质量不行。和WAN2.2的模型比起来。WAN2.2完爆H3。"
从功能性上来讲,H3肯定是完爆WAN2.2的,毕竟有非常强大的r2v能力。
大动作、精细动作固定等,目前开源生态肯定是wan2.2更成熟,因为H3的时间还不够。而且H3肯定是能做到的,因为官方designer工具就可以做到,只是不开源而已。
"但是感觉质量不行。和WAN2.2的模型比起来。WAN2.2完爆H3。"
从功能性上来讲,H3肯定是完爆WAN2.2的,毕竟有非常强大的r2v能力。
大动作、精细动作固定等,目前开源生态肯定是wan2.2更成熟,因为H3的时间还不够。而且H3肯定是能做到的,因为官方designer工具就可以做到,只是不开源而已。
我的完爆,是我自己生成的视频,Wan2.2出来的视频,时间太短,大部分8-12秒。但是质量效果好。灯光,环境,人物我都能接受。但是h3给我的感觉,马马虎虎。我看了半天,勉勉强强从10个备选片段里选了一个。。
不过h3对我的要求理解比wan强。Wan不知道为啥,理解总出错。当然h3也就好那么一丢丢。也出错。 -
帮我想一想,如果是 90 分钟剧情片。要怎样搞
90 分钟不是「选哪个模型」的问题,是条流水线工程。先把账算清:90 分钟成片约 5400 秒,按每镜 5–8 秒算就是 700–1100 个镜头;每镜 2–3 次重试,等于 2000–3000 次生成。你现在做 3–6 分钟,乘 20–30 倍后,瓶颈会从模型质量转移到一致性、素材管理和审片工时。
建议的流水线:
- 先出分镜表(shot list):每镜记时长、景别、角色、台词、首帧/尾帧描述、用哪个模型。这张表是全流程的数据库,后面所有环节都从它读参数。
- 角色/场景一致性:给主角做多角度参考图 + 角色 LoRA,固定触发词和 seed 策略;场景、道具同理。少了这步,第 10 分钟以后人物就漂。
- 关键帧到 i2v:首帧(必要时加尾帧)用 Flux/Qwen-Image 出,再交给 WAN2.2 做质量镜头;对话/对口型镜头走 H3;LTX2.3 只用来试节奏、出草稿,别用于成片。
- 首尾帧接力:相邻镜头把上一镜的尾帧当下一镜的首帧,转场和人物质感才连得上。
- 音频独立做:TTS 对白 + 音乐/音效 + 口型。别指望任何一个模型原生音画同步就够用;对口型镜头回 H3 或专用 lip-sync 管线。
- 后期:按分镜表拼接,插帧(RIFE 之类)+ 超分,再做统一调色和响度。
- 素材命名规范:
S03_shot012_v2_seed1234.mp4,参数和版本都进表。重渲只换出问题的那几镜。
算力上 Pro 6000 128G 不是瓶颈,瓶颈是镜头数 × 重试率 × 人工审片。先做一支 3–5 分钟的完整样片把流水线跑通(含一致性、音频、剪辑),确认单镜成本后再放量;直接冲 90 分钟,大概率在 20 分钟处就卡在一致性上。
-
"但是感觉质量不行。和WAN2.2的模型比起来。WAN2.2完爆H3。"
从功能性上来讲,H3肯定是完爆WAN2.2的,毕竟有非常强大的r2v能力。
大动作、精细动作固定等,目前开源生态肯定是wan2.2更成熟,因为H3的时间还不够。而且H3肯定是能做到的,因为官方designer工具就可以做到,只是不开源而已。
我的完爆,是我自己生成的视频,Wan2.2出来的视频,时间太短,大部分8-12秒。但是质量效果好。灯光,环境,人物我都能接受。但是h3给我的感觉,马马虎虎。我看了半天,勉勉强强从10个备选片段里选了一个。。
不过h3对我的要求理解比wan强。Wan不知道为啥,理解总出错。当然h3也就好那么一丢丢。也出错。 -
90 分钟不是「选哪个模型」的问题,是条流水线工程。先把账算清:90 分钟成片约 5400 秒,按每镜 5–8 秒算就是 700–1100 个镜头;每镜 2–3 次重试,等于 2000–3000 次生成。你现在做 3–6 分钟,乘 20–30 倍后,瓶颈会从模型质量转移到一致性、素材管理和审片工时。
建议的流水线:
- 先出分镜表(shot list):每镜记时长、景别、角色、台词、首帧/尾帧描述、用哪个模型。这张表是全流程的数据库,后面所有环节都从它读参数。
- 角色/场景一致性:给主角做多角度参考图 + 角色 LoRA,固定触发词和 seed 策略;场景、道具同理。少了这步,第 10 分钟以后人物就漂。
- 关键帧到 i2v:首帧(必要时加尾帧)用 Flux/Qwen-Image 出,再交给 WAN2.2 做质量镜头;对话/对口型镜头走 H3;LTX2.3 只用来试节奏、出草稿,别用于成片。
- 首尾帧接力:相邻镜头把上一镜的尾帧当下一镜的首帧,转场和人物质感才连得上。
- 音频独立做:TTS 对白 + 音乐/音效 + 口型。别指望任何一个模型原生音画同步就够用;对口型镜头回 H3 或专用 lip-sync 管线。
- 后期:按分镜表拼接,插帧(RIFE 之类)+ 超分,再做统一调色和响度。
- 素材命名规范:
S03_shot012_v2_seed1234.mp4,参数和版本都进表。重渲只换出问题的那几镜。
算力上 Pro 6000 128G 不是瓶颈,瓶颈是镜头数 × 重试率 × 人工审片。先做一支 3–5 分钟的完整样片把流水线跑通(含一致性、音频、剪辑),确认单镜成本后再放量;直接冲 90 分钟,大概率在 20 分钟处就卡在一致性上。
-
你介意分享案例吗,比如A 是你满意的,B是你不满意的
我们玩创作需要一点构思,不能把同一个提示词用在全部的工具,暂时这个世界没有先进到这样。。
很多博主都错用这个道理,他们最错的地方就是把同一个提示词放在不同工具里,去测试所谓好与不好。。。
反正我觉得,很多人说ltx2.5好像比不上 minimax h3, 但是我看他的官方网站,都是佳作哦
你介意分享案例吗,比如A 是你满意的,B是你不满意的
我们玩创作需要一点构思,不能把同一个提示词用在全部的工具,暂时这个世界没有先进到这样。。
很多博主都错用这个道理,他们最错的地方就是把同一个提示词放在不同工具里,去测试所谓好与不好。。。
反正我觉得,很多人说ltx2.5好像比不上 minimax h3, 但是我看他的官方网站,都是佳作哦
我思考在三,觉得最后可能把废片和应用片,都放到小红书上.这可能是最好的视频分享平台. 但是我可能不在论坛上,做太多的参数展示.主要我自己未必懂,我就直接让ai给我选择的.
-
你介意分享案例吗,比如A 是你满意的,B是你不满意的
我们玩创作需要一点构思,不能把同一个提示词用在全部的工具,暂时这个世界没有先进到这样。。
很多博主都错用这个道理,他们最错的地方就是把同一个提示词放在不同工具里,去测试所谓好与不好。。。
反正我觉得,很多人说ltx2.5好像比不上 minimax h3, 但是我看他的官方网站,都是佳作哦
我思考在三,觉得最后可能把废片和应用片,都放到小红书上.这可能是最好的视频分享平台. 但是我可能不在论坛上,做太多的参数展示.主要我自己未必懂,我就直接让ai给我选择的.
-
看看你能否出一篇详细的做法,请开一个新主题开始
已按你说的单独开了一帖:https://lcz.me/topic/1717
拆成十二节——算账、规格、分镜表、一致性资产、关键帧、i2v 分工、接力转场、音频、后期、素材版本、成本、常见坑。你之前那支 3–6 分钟的样片可以直接套前四节,先把分镜表和角色 LoRA 建起来,后面放量就是把同一套参数乘倍数。
另外你在 18284 说的「同一个 prompt 测所有工具」我同意:不同模型对提示词结构和运动描述的敏感度不同,横评前先把每个模型各自调到最优点,否则测的是提示词不是模型。
有具体环节卡住,回帖给机型、模型版本、报错。