先交代背景:我是一个人业余做的,陆陆续续写了大半年。没有团队,没有融资,就是自己用着顺手,然后越做越大了。
做了个什么东西

一句话:输入一个主题(比如"咖啡的历史"),自动出一整条 YouTube 视频脚本、画面、配音、配乐、合成,最后连标题、描述、封面缩略图都给你生成好。你只需要输入一句话,然后按几个按钮。
拆开看是这几层:
- 用本地 LLM 当"导演":根据视频类型(纪录片/悬疑/科普/动漫/电影/音乐视频)调用不同的提示词体系,生成逐场景的旁白、画面描述、运镜描述。现在有 28 套不同风格的"导演提示词包"
- 用 ComfyUI 生成图片和视频(图生视频),全本地跑
- TTS 配音 + 自动合成最终视频
- 针对 YouTube 做了标题生成(一次给 3 个候选)、开场 30 秒钩子、缩略图叠加文字
- 支持角色一致性:上传一张角色照片,后面所有场景的角色脸都是这张脸
为什么不用现成的工具
市面上不是没有,但我的场景很具体:我想批量做知识类/悬疑类短视频,需要的是"一条流水线",而不是一个个孤立的生成工具。而且我比较在意内容一致性,同一个视频里角色脸不能变、风格不能飘。现成工具在这块都做得不够好,干脆自己写。
全部本地运行,数据不出电脑,没有按次计费的 API 成本(显卡电费另说)。
现状
- 功能上已经能完整跑通视频生成,效果我自己觉得还行(不吹,就是"能看"的水平,离专业还远, 可以看看我这个刚建的 Youtube频道 )
- 依赖一台 RTX 5090(32GB 显存),模型文件加起来 17GB+,安装门槛比较高
- 目前只有我一个人在用,没发过
想听听大家意见的,主要是这几个问题
-
产品形态:现在是个本地 Web UI(浏览器里操作),对会用的人来说挺顺,但对普通用户门槛太高(要装 Python、ComfyUI、一堆模型)。是应该往"一键安装的桌面应用"走,还是干脆做云端(用户不用装任何东西,按分钟付费)?
-
目标用户:我一直觉得最有价值的场景是"批量做 YouTube 视频的人",独立创作者、MCN、跨境电商卖家。但也有人跟我说应该做 B2B 白标(给机构定制品牌版)。这两个方向我自己很摇摆,想听听过来人的看法。
-
怎么定价:本地版(用户自己有显卡)和云端版(用我的算力),大家觉得哪种更合理?订阅还是买断?
-
商业化 vs 开源:核心的提示词体系、流水线是我觉得最有价值的部分。是应该闭源卖钱,还是开源引流、卖云服务?也想知道大家对这类"本地 AI 工具"开源的看法。
说句实话,我现在的状态是"东西做出来了,但不知道下一步往哪走"。技术上我挺有信心,商业上完全没底。任何意见都欢迎,哪怕是"别做了"也行,至少让我死心。
谢谢看到这里。
大佬!