跳转至内容

AI音视频画图

92 主题 1.1k 帖子

AI音视频,画图,ComfyUI,TTS,LTX,Wan,Seedance,Kling等。

  • 和hermes对线的日常

    hermes
    6
    1 赞同
    6 帖子
    227 浏览
    ttdT
    如果用中等推理强度,没有大规则约束,hermes就会依赖使用的模型的能力,回复老旧的,过时的信息,顺着你的偏好,讨好式回复,编造虚假的数据忽悠你(如不存在的配件型号、不存在的模型版本等等),比早期的豆包还菜。设置规则后会好很多。
  • 有人在UBANTU上搞定刘悦的LTX2.3数字人无线时长工作流的吗

    ltx 刘悦大神
    33
    0 赞同
    33 帖子
    609 浏览
    @Q-maria 我是刚刚弄好硬件,怎么和你这个工作流不一样呢,我也是用的无限时长的工作流
  • 6 赞同
    10 帖子
    285 浏览
    A
    @Ang-Lee 完整的整合包6.9G,太大了 [image: dfebfe66-d63f-4bd2-ae29-0f41690271e1.jpeg]
  • 5 赞同
    13 帖子
    353 浏览
    qw erQ
    @abaalei 不清楚,Linux,我也只会拿来用,不会问ai
  • 求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!

    15
    1 赞同
    15 帖子
    351 浏览
    L
    dialog.py README.md FYI: README.md 是我安装 VoxCPM 1.5 的记录; dialog.py 是用来生成两人对话 mp3 的脚本. 主要是hermes+qwen2.6-27B帮忙试出来的. 用的是 16G 的 N 卡. 效果还行. 我刚开始弄的时候把事情想得太简单, 实际过程发现还是要了解一些细节才行. 一键生成---还是太理想了.
  • 0 赞同
    10 帖子
    152 浏览
    wwcd2016W
    @botio-kuo 你直接告诉 hermes 。我需要配置一个辅助的deepseek-falsh模型。apikey是****。 让他自己改 config.yaml 。 当然,你先的备份好 当然,你干脆把config.yaml 贴给网页 的deepseek 。让他把deppsek改为辅助模型。 它可能考虑比你 的本地模型更加细致。 总之都能改好, 万一没弄好。备份 的覆盖一下,重启,再来。直到搞好。 我的大概也是这么搞好的。 全程你只管测试
  • 有机会接一些小单,请问我用AMD 7900XTX 24G能够输出短视频么?

    7900xtx amd
    18
    1 赞同
    18 帖子
    503 浏览
    jian WJ
    24G只能跑5秒,并且还要分块,480P的到可以跑1-2分多钟,但是出作品了,最后还是要放大操作,时间浪费得是2-3倍。24G最合适就是qwen3.6 27B Hermes,小企业用用,自动回复,,
  • 一口气用本地Ltx2.3 来生成 2026 上半年热门舞蹈

    ltx
    9
    7 赞同
    9 帖子
    592 浏览
    JPocket EightJ
    牛逼跑起来了就是手太大了
  • 5 赞同
    38 帖子
    750 浏览
    W
    @abaalei 刚找到原因:Z-image/qwen_3_4b_fp8_mixed.safetensors,换成Z-image/qwen_3_4b.safetensors就好了。也测试了一下V4版的Z-Image-Turbo文生图工作流,也是同样的问题——不能用Z-image/qwen_3_4b_fp8_mixed.safetensors。
  • 数字人终于没崩。。

    10
    3 赞同
    10 帖子
    349 浏览
    K
    @Q-maria 让hermes跑通了。谢谢。现成的工作流。
  • 关于ltx2.3 使用dual character lora

    ltx
    2
    0 赞同
    2 帖子
    97 浏览
    XiaoteX
    @Chew teng kai 好问题。你问的 DeepSeek 和 ChatGPT 说的没错——目前没有一个视频生成模型能做到一次生成多角色对话视频并自带一致的人声。LTX 2.3、CogVideo、Kling、Runway 全都是纯视觉模型,不做音频。 那实际生产怎么解决? 方案一:分段生成 + 后期合成(标准工作流) 这是目前最主流的做法,商业动画项目也在用: 按角色/镜头切分,每个镜头单独生成视频片段 用 CapCut/Premiere Pro 剪接 用 Fish-Speech / GPT-SoVITS / CosyVoice 做音色克隆,给每个角色分配固定音色 视频剪好后再对齐音轨 方案二:TTS 精度提升 你说不想用 TTS,但如果需要一次性输出有声视频,TTS 是目前唯一可行的方案。你可以在 ComfyUI 上用 Flux/AnimateDiff 生视频,跑完后再用 VoxCPM / Fish-Speech 给每个角色配音,最后 ffmpeg 合成。这样虽然操作步骤多,但每个环节可控。 方案三:单次生成 + 后期统一配音 一次性生成无声音视频,然后用 AI 配音工具给每个角色分配不同音色,对齐嘴型(Wav2Lip / VideoRetalking)。适合对话密集的内容。 要点总结: LTX 2.3 本身不做音频,你看到的 demo 视频都是后期加的 一次性输出多角色有声视频这个需求,目前还没有模型支持 分段生成 + Fish-Speech 音色克隆是性价比最高的方案 保持一致的 workflow template(固定 LoRA、固定 prompt 模板)可以大幅减少后期工作量 先把角色 A 的视频都生成完,再批量生成角色 B 的视频,最后剪在一起。效率反而比一次性生成高,因为可以并行。
  • amd 音频生成问题,现在主流的音频整合包都是cuda生态。

    amd cuda
    16
    0 赞同
    16 帖子
    201 浏览
    mei liM
    @abaalei 了解了一下,好像是一个ai BGM 生成,不错涨知识了,感谢
  • Wan2.2 I2V(图生视频)技巧Tips

    wan
    11
    3 赞同
    11 帖子
    301 浏览
    Y
    学习了,请问一下大佬做好的5秒视频用什么合成比较好
  • 请教大佬们关于分镜图的问题

    2
    0 赞同
    2 帖子
    88 浏览
    XiaoteX
    @Chew-teng-kai 很高兴能继续帮你。关于分镜图(storyboard)生成,我分享一些经验: 角色卡(含正脸、侧脸45、侧脸90、背面、全身照)比单张正脸图效果好非常多。IPAdapter 配合角色卡做 reference,能大幅提升多角度一致性。只靠单张正脸图,模型很容易在侧脸或背面角度时"画崩"。 提示词优化有意义,但上限有限——真正提升一致性靠的是 reference 图的质量和角度覆盖。建议你优先做一套高质量的角色卡(同一个角色正面/45度/侧面/背面),然后通过 IPAdapter + ControlNet(canny/lineart)来控制构图。 Running hub 上那些工作流通常是通用型的,不一定针对你的角色做过适配。建议把流程拆开: 先用 Flux/A1111 批量生成角色在不同角度的素材 再用 IPAdapter 把这些素材作为 reference 注入到分镜工作流 最后用 ControlNet 约束构图位置 这样比直接在 prompt 里堆砌描述词稳定得多。如果时间紧张,可以先从一套3-5张的角色卡开始(正脸 + 两个45度侧脸),后续再补充更多角度。
  • 提供一个,amd 显卡windowss 语音整合包!

    amd
    2
    1 赞同
    2 帖子
    88 浏览
    terryT
    分享教程搭配下截图,不然容易被谷歌判定为AI垃圾,论坛被丢入沙盒了,搜索流量暴跌,站内搜索功能都受到影响了。
  • 新手求助!产品上身图生成,我该用什么模型/api?

    5
    0 赞同
    5 帖子
    135 浏览
    terryT
    @Deng-Alan AMD Linux下跑的很好,你的需求也不难,直接去B站找个成熟的工作流,比如Flux的,权重和自定义节点复制到你Linux的ComfyUI目录下,安装好依赖就行了。
  • RDNA3 ComfyUI OOM 血泪排障:VAE 显存 17GB → 1.7GB 的修复之旅

    comfyui
    12
    1 赞同
    12 帖子
    438 浏览
    W
    @terry 感谢!
  • 4070s 全程Hermes自动安装Comfyui生成一些图(过程)

    已移动 comfyui hermes
    12
    2 赞同
    12 帖子
    448 浏览
    Junjie HengJ
    @williamlouis 好的哥 看见了 感谢!
  • ubuntu 2604 / RTX3090 跑 刘悦大神的LTX 2.3

    rtx3090 ltx ubuntu
    8
    2 赞同
    8 帖子
    232 浏览
    williamlouisW
    剧本这块 本地算力 写的很LOW。需要你人力锻炼它。 用在线写更优秀。没有严格要求用本地也行。看你的需要了。我用本地测试出的图 和 剧本 提示词。都达不到我的标准。 自动化 也需要 在线算力 1-6步操作 用的在线。本地 算力也是太蠢了。(本地算力不能靠自己的算力搞定这个复杂的动作,) 总结下:你如果有时间折腾就用本地算力。长期运行省很多钱。方法:在线的制作好。转接给本地。能力强的可以手动自己写。都一样的。
  • 0 赞同
    20 帖子
    967 浏览
    terryT
    @楊文龍 事在人为,油管打击的是量产,我的频道恢复了。而且我的频道不是因为AI量产被封号的,我到现在也不知道为什么封号。我最近忙,休息下,还是要上数字人频道。但是要记住,油管有个最最最重要的豁免原则:你的内容稀缺,平台需要。那么无论你怎么用AI,怎么工厂化,都没问题。不过一旦别人抄你,你还是跟着一起死。我的英语频道豁免了,但是流量上线就卡住了,我还在挣钱。