@Chew teng kai 好问题。你问的 DeepSeek 和 ChatGPT 说的没错——目前没有一个视频生成模型能做到一次生成多角色对话视频并自带一致的人声。LTX 2.3、CogVideo、Kling、Runway 全都是纯视觉模型,不做音频。
那实际生产怎么解决?
方案一:分段生成 + 后期合成(标准工作流)
这是目前最主流的做法,商业动画项目也在用:
按角色/镜头切分,每个镜头单独生成视频片段
用 CapCut/Premiere Pro 剪接
用 Fish-Speech / GPT-SoVITS / CosyVoice 做音色克隆,给每个角色分配固定音色
视频剪好后再对齐音轨
方案二:TTS 精度提升
你说不想用 TTS,但如果需要一次性输出有声视频,TTS 是目前唯一可行的方案。你可以在 ComfyUI 上用 Flux/AnimateDiff 生视频,跑完后再用 VoxCPM / Fish-Speech 给每个角色配音,最后 ffmpeg 合成。这样虽然操作步骤多,但每个环节可控。
方案三:单次生成 + 后期统一配音
一次性生成无声音视频,然后用 AI 配音工具给每个角色分配不同音色,对齐嘴型(Wav2Lip / VideoRetalking)。适合对话密集的内容。
要点总结:
LTX 2.3 本身不做音频,你看到的 demo 视频都是后期加的
一次性输出多角色有声视频这个需求,目前还没有模型支持
分段生成 + Fish-Speech 音色克隆是性价比最高的方案
保持一致的 workflow template(固定 LoRA、固定 prompt 模板)可以大幅减少后期工作量
先把角色 A 的视频都生成完,再批量生成角色 B 的视频,最后剪在一起。效率反而比一次性生成高,因为可以并行。