请教:X99 + 128G 内存 + 4090 48G / 3090 24G,怎么搭建本地电商 UGC 工作流?
-
最近想搭一套纯本地的 AI 电商 UGC 内容生产工作流,主要用于制作 TikTok、Reels、独立站广告素材。
目前的硬件配置:
X99 洋垃圾平台
128GB DDR4 内存
4090 48GB 显存
3090 24GB 显存
想实现的内容包括:
根据产品图生成使用场景
固定人物形象和产品外观
生成真人出镜、手持产品、开箱或体验类视频
AI 口播、配音、对口型
批量生成不同人物、场景、语言和广告开头
最后自动剪辑成 15~30 秒的 UGC 短视频
现在考虑用 ComfyUI 搭主工作流,但模型和节点太多,有点不知道该怎么组合。想请教各位大神:
图片和人物一致性用什么模型比较合适?FLUX、Qwen Image,还是其他模型?
图生视频推荐 Wan、HunyuanVideo、LTX-Video,还是别的方案?
产品外观和 Logo 怎么才能尽量不变形?
数字人口播、声音克隆和对口型分别推荐什么本地模型?
4090 48G 和 3090 24G 能否同时利用?适合怎样分配任务?
有没有比较成熟的 ComfyUI 工作流或开源项目可以参考?
如果想做成批量流水线,大家会怎么拆分脚本、图片、视频、配音和剪辑环节?
我更看重产品还原度、人物一致性和批量生产效率,速度慢一点可以接受。希望尽量在本地完成,减少 API 成本,也方便后续针对特定产品训练 LoRA。
欢迎做过电商广告、AI UGC 或 ComfyUI 工作流的大佬分享一下模型组合、踩坑经验和工作流思路。感谢!
-
你这个配置搭本地电商 UGC 流水线完全可行,X99 + 128G 内存 + 48G/24G 双卡是够用的底子。按你的 8 个问题逐个给结论:
1. 图片和人物一致性
- 产品还原度:首选 FLUX.1-dev(fp8 即可),针对你的产品图集训一个产品 LoRA(30~50 张多角度产品照,几小时能训完),这是产品外观还原最稳的路子,没有之一。
- 固定人物形象:FLUX 上挂 InstantID 或 PhotoMaker v2 节点(用参考图锁定身份),配合固定 seed 保证跨批次同一个人。不想训 LoRA 就 PhotoMaker + 参考图起步。
- Logo/文字:FLUX 和 Qwen-Image(20B)文字渲染都很强,Qwen-Image 对中文和 Logo 更准但更吃显存、生态不如 FLUX 顺。建议主链路全用 FLUX,需要精确 Logo 的场景单独调 Qwen-Image。
2. 图生视频
- 主力选 Wan 2.1/2.2 14B(i2v 版)。4090 48G 跑 fp8 没问题,5 秒片段几分钟内出,是目前本地图生视频质量和生态平衡最好的。
- HunyuanVideo 13B 是文生视频强、图生视频弱,且显存开销大,不适合你这个场景。
- LTX-Video 快但质量差一档,批量试跑找感觉可以用,成片别指望它。
- 流程:场景图 → Wan i2v,以产品图为首帧,人物一致性靠固定人物图 + 固定 seed。
3. 产品外观和 Logo 不变形
三层保险:产品 LoRA(外观锚点)+ IPAdapter/ControlNet 参考图(结构约束)+ Wan i2v 首帧直接钉死产品图。
分镜固定机位、镜头运动幅度控制在小范围(轻微 pan/zoom),变形概率大幅下降;批量时把镜头运动强度参数锁死。4. 数字人、声音克隆、对口型
- 真人出镜口播:用一张人像图走 Wan i2v 生成,或 LivePortrait 直接驱动人像。
- 声音克隆:CosyVoice 2(阿里开源,零样本克隆效果好、中文强、支持多语言)起步;想要音色更像原声再上 GPT-SoVITS。
- 对口型:MuseTalk(口型同步,比 Wav2Lip 好很多)配 LivePortrait(表情驱动)。
- 完整链路:CosyVoice2 出音频 → MuseTalk 对到人物视频;多语言脚本翻译交给本地 Qwen 27B。
5. 4090 48G + 3090 24G 同时利用
- 别走双卡 TP:ComfyUI 里视频模型跨卡分片基本不现实,多数节点不支持,显存还翻倍。
- 现实方案:双 ComfyUI 实例并行(CUDA_VISIBLE_DEVICES 各指一卡)。4090 专职出图 + 图生视频(重活),3090 专职配音、对口型、换脸、放大等轻活,或跑第二个生成队列做批量试跑。
- 音频、ASR、翻译这类 CPU 就能干,128G 内存很富余,别占显卡。
- 最终就是流水线:4090 产图产视频 → 3090 产口播配音对口型 → FFmpeg 拼接。
6. 成熟工作流/开源项目参考
- Kijai 的 ComfyUI-WanVideoWrapper(Wan 视频工作流事实标准)。
- ComfyUI-LivePortraitKJ、MuseTalk 的 ComfyUI 节点、ComfyUI-PhotoMaker / InstantID 节点,换脸备选 ComfyUI-ReActor。
- GitHub 搜 comfyui ecommerce workflow / comfyui ugc workflow 有现成骨架,先跑通再改。
7. 批量流水线拆分
按顺序串,每步独立脚本、产出落盘,下步消费上步目录:- 脚本:本地 Qwen 27B 按产品卖点批量生成 N 版分镜文案 + 多语言翻译(输出 JSON)。
- 出图:FLUX + 产品 LoRA + 人物节点,每产品 10~20 张场景图(固定 seed 组)。
- 图生视频:Wan i2v,每图 5 秒片段。
- 配音:CosyVoice2 克隆音色,按文案批量 TTS。
- 对口型:MuseTalk 把音频对到人物视频。
- 剪辑:FFmpeg 自动拼 15~30 秒 + 字幕 + 前 2 秒产品特写钩子。
这样任何环节失败可单独重跑,以后换产品只需重训 LoRA,不用重跑全链。
8. 落地一句话
用 ComfyUI API 模式(workflow.json + /prompt 接口批量提交)做编排,别手动点 UI。你接受速度慢,那就 4090 把 Wan 质量拉满,3090 挂辅助任务,X99 + 128G 完全兜得住。建议先搭通最小链路:产品图 → Wan 视频 → CosyVoice2 → MuseTalk → FFmpeg,跑通后再加批量。卡在哪一步随时回来贴 workflow 截图。
-
根据你要做的是电商的目标,推荐一个补充方案:
文生文:本地QWEN做基础仿写,推荐搭配上claud code做终稿,分镜推荐用豆包专业版(这方面有几把刷子)图生视频这方面,WAN和LTX交叉对比使用,5秒的短片段+10-15秒的长片段(预算够建议考虑seedance2.0或以上)
TTS:VOXCPM,INDEXTTS2。如果用cosyvoice2来克隆音色,情绪控制和分段方面要格外注意,否则很容易在这个环节浪费大量时间
对口型:除了MUSETALK,推荐github上另一个半开源的ltsmsync,以及推荐在预算够用时,使用火山的omnihuman1.5,1元/S,看是真的省心
剪辑
FFMPEG的自动拼接,目前用过许多次,效果不是很稳定。如果是做电商,推荐同时导出一个剪映工作流做备用