【AI 视频生成工具】做了一个全本地的 AI 视频生成工具,想听听大家意见下一步怎么走
-
是的, 视频模型是LTX2.3, 效果很多不是特别好,等minimax h3 开源之后换个试试看
-
@williamlouis 谢谢你的反馈,你说的成功案例的例子是指油管赚钱了吗? 还是说用户应用上面?我其实目前也是在探路阶段,各种意见对我来说都很宝贵
-
你上个成品到油管。之后分享下链接。私信或公开都行。眼见为实
-
补充一点视频模型层面的看法:LTX-2 系胜在快,但复杂运动和中长镜头的一致性偏弱。你说的"很多效果不是特别好",除了模型本身,还有一个常见的"杂乱感"来源值得先排除——场景间风格漂移。
28 套导演提示词包如果各自对镜头语言、色调、构图的描述差异太大,画面就会显得跳。两个马上能做的改进:
- 给所有提示词包挂一个共享的风格锚点(统一的调色、构图约束),让场景之间风格连续;
- 你已经有角色一致性,把同一套 reference 思路复用到场景风格上(比如固定 LUT 或 style reference),观感会立刻整齐很多。
换 minimax h3 之前建议先把这两点固化,这样换完模型 A/B 对比才有意义——否则分不清提升来自模型还是流程。开源模型这边,优先选 ComfyUI 节点生态成熟、社区验证多的(LTX-2、Wan、HunyuanVideo 都在这个范围),迁移成本最低。
-
先交代背景:我是一个人业余做的,陆陆续续写了大半年。没有团队,没有融资,就是自己用着顺手,然后越做越大了。
做了个什么东西

一句话:输入一个主题(比如"咖啡的历史"),自动出一整条 YouTube 视频脚本、画面、配音、配乐、合成,最后连标题、描述、封面缩略图都给你生成好。你只需要输入一句话,然后按几个按钮。
拆开看是这几层:
- 用本地 LLM 当"导演":根据视频类型(纪录片/悬疑/科普/动漫/电影/音乐视频)调用不同的提示词体系,生成逐场景的旁白、画面描述、运镜描述。现在有 28 套不同风格的"导演提示词包"
- 用 ComfyUI 生成图片和视频(图生视频),全本地跑
- TTS 配音 + 自动合成最终视频
- 针对 YouTube 做了标题生成(一次给 3 个候选)、开场 30 秒钩子、缩略图叠加文字
- 支持角色一致性:上传一张角色照片,后面所有场景的角色脸都是这张脸
为什么不用现成的工具
市面上不是没有,但我的场景很具体:我想批量做知识类/悬疑类短视频,需要的是"一条流水线",而不是一个个孤立的生成工具。而且我比较在意内容一致性,同一个视频里角色脸不能变、风格不能飘。现成工具在这块都做得不够好,干脆自己写。
全部本地运行,数据不出电脑,没有按次计费的 API 成本(显卡电费另说)。
现状
- 功能上已经能完整跑通视频生成,效果我自己觉得还行(不吹,就是"能看"的水平,离专业还远, 可以看看我这个刚建的 Youtube频道 )
- 依赖一台 RTX 5090(32GB 显存),模型文件加起来 17GB+,安装门槛比较高
- 目前只有我一个人在用,没发过
想听听大家意见的,主要是这几个问题
-
产品形态:现在是个本地 Web UI(浏览器里操作),对会用的人来说挺顺,但对普通用户门槛太高(要装 Python、ComfyUI、一堆模型)。是应该往"一键安装的桌面应用"走,还是干脆做云端(用户不用装任何东西,按分钟付费)?
-
目标用户:我一直觉得最有价值的场景是"批量做 YouTube 视频的人",独立创作者、MCN、跨境电商卖家。但也有人跟我说应该做 B2B 白标(给机构定制品牌版)。这两个方向我自己很摇摆,想听听过来人的看法。
-
怎么定价:本地版(用户自己有显卡)和云端版(用我的算力),大家觉得哪种更合理?订阅还是买断?
-
商业化 vs 开源:核心的提示词体系、流水线是我觉得最有价值的部分。是应该闭源卖钱,还是开源引流、卖云服务?也想知道大家对这类"本地 AI 工具"开源的看法。
说句实话,我现在的状态是"东西做出来了,但不知道下一步往哪走"。技术上我挺有信心,商业上完全没底。任何意见都欢迎,哪怕是"别做了"也行,至少让我死心。
谢谢看到这里。
还是干脆做云端(用户不用装任何东西,按分钟付费)?
突然想到市場需求了, 朋友和家人過生日, 求婚影片, 這錢花得值得
可以先做一些模板 方便套用, 最好是能上載人物照片的
讓現實人物 電影化
我沒相關經驗, 但我覺得這個有市場, 可以先看目前其他商業平台的價格, 只要比其他平台低, 就有足夠的吸引力, 朝簡單方便, 品質差不多就行了,
但要做24/7 24小時連續營運 要考慮伺服器架構,
還要自己架伺服器(另一筆投資), 但scalability 可擴性會是個問題
假如是去租用雲端 (單位成本也要考量)
或者是混合式的也行 私有伺服器上用戶太多 就啟動雲端上的服務反正先試水溫, 如果用戶暴增了 再短時間內啟動預備方案, 儘量控制測試成本
-
我不敢说太多,因为说出来一定爆。。。。
以其你去创作,倒不如你去找爆款,然后抄他的工作流,放在你的版页。。。。
然后再放那些乱7八糟的爆款工作流,让自己显得很有办法。。
真正赚钱的,就等专案上门。。。我再给你一个点子:比如你现在创作星爷功夫女足的工作流。。。不用整套电影那么夸张,就拿女足场景踢球就好
-
,系统 取消固定了此主题
-
@imbiplaza-asus 这会有侵权风险吧?
-
@kos-or 其实我有做一个saas服务,但是连接seedream的,按点数算,只是一直还没上线因为seedream一张图片成本也很高。
@williamlouis 成品在这 https://www.youtube.com/watch?v=DRrDg7b-oXU, 这是我的测试运营 Youtube频道 https://www.youtube.com/@CurioLabScience -
@fcme 感谢
技术大牛给我建议,我也还在找路。
昨天刚刚尝试了h3,效果确实要比ltx好,有兴趣可以看看成品https://www.youtube.com/watch?v=OF5AR_tefhI -
@kos-or 其实我有做一个saas服务,但是连接seedream的,按点数算,只是一直还没上线因为seedream一张图片成本也很高。
@williamlouis 成品在这 https://www.youtube.com/watch?v=DRrDg7b-oXU, 这是我的测试运营 Youtube频道 https://www.youtube.com/@CurioLabScience -
@kos-or 一台只够一个人用,只要有人在用就会满载。
刚刚又用H3生成了一个视频
大家有兴趣可以看看效果,我正在优化怎么可以变成长视频短剧
Youtube Video -
@imbiplaza-asus 这会有侵权风险吧?
@Quanta-Magic 基本功都练不好,还谈什么创作,你知道张大千成为张大千之前,临摹了人家的作品多少年吗,你知道星爷在成为星爷之前,不断研究日本动画,动漫,学习,抄袭,模仿了多少年吗。。
所以我一开头已经说了,讲出真道理一定会爆款,因为人家真实在爆款着,为什么你偏要去反道而行
-
@kos-or 一台只够一个人用,只要有人在用就会满载。
刚刚又用H3生成了一个视频
大家有兴趣可以看看效果,我正在优化怎么可以变成长视频短剧
Youtube Video我剛看了博主Terry的介紹 MiniMax-H3 ,
這樣看來開源 H3是不是直接把你的自動化工作流開放了?https://huggingface.co/spaces/multimodalart/minimax-h3
MiniMax-H3 是一個擁有 330 億個參數的先進視訊生成模型,可產生視訊和完全同步的音軌(環境音、擬音、語音)。
-
@kos-or 一台只够一个人用,只要有人在用就会满载。
刚刚又用H3生成了一个视频
大家有兴趣可以看看效果,我正在优化怎么可以变成长视频短剧
Youtube Video -
一台只够一个人用,只要有人在用就会满载。
你有一台很好的機器 可以先暫時上掏寶或其他平台接單,
大家很忙, 不是每個人都有空搞這些影片,
生日或年節到了 花個錢做個影片的商機 我認為會有的我之前遇到一個案子是要做語音模仿,
模仿某一個人說話的聲音, 做紀念用
案主只有對方唱歌時的聲音檔, 但聲音太小;
反正可能要先做一些前置處理 我也沒空處理這個 就沒答應接案 ; -
再分享一个H3生成的视频
Youtube Video -
再分享一个H3生成的视频
Youtube Video -
@tony-wang 我有考虑做成saas,不过由于需要显卡,那就只能用runninghub 之类的,太不方便了,而且资源有限,不知道如何实现