跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. AI音视频画图
  3. 求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!

求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!

已定时 已固定 已锁定 已移动 AI音视频画图
15 帖子 8 发布者 352 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • Stoma StomaS Stoma Stoma

    求助,文字(文案、剧本)转音频(单人口播),
    AI 音太明显,口播过程声音还会变形,感觉一个口播稿放完似乎换了几个人,声音全程稳定性不够。
    显卡 RTX 3050 8G 显存


    过程:一开始使用 claude code 推荐 CosyVoice 给我选择了一个川渝口音,不合适。
    看了视频,觉得 voxcpm 好像不错,就选了 voxcpm 一上来就开始牛逼轰轰的克隆别人声音,做出试听的 DEMO 发现一团糟(杂声,断句前加其它音等等)一看,这不行,就先把声音这事先搁置了,先搞文案了。
    巧的很,方案搞得差不了,看到超版的视频,voxcpm2 好像能再试一下,使用 claude code 一顿操作,感觉快看到这个路走通的希望,但一按方案做出 DEMO 好像还是回到了原点。


    我不懂编程也不懂技术,全是使用 claude code 一顿想当然的输出。
    针对现状,应该如何解决(声音稳定、声音似人度高、声音感情调整后还能听起来像一个人):是更换 TTS 还是调整和 AI agent 沟通提示词,还是有其它 Skill 可以借鉴,还是有其它路径,求大神指点。

    terryT 在线
    terryT 在线
    terry
    超级版主
    编写于 最后由 terry 编辑
    #4

    @Stoma-Stoma VoxCPM毫无疑问是够用的,你可以尝试1.5版本,2.0我测试了,并无明显优势,而且还慢一些。口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。

    你把这段话贴给你的CC看,让它照着操作。另外参考声音你去找一个你喜欢的真人主播,或者其他你听过的,觉得拟真度比较高的AI语音,不要随便选AI语音,它的克隆很精准,你给一坨屎给它模仿,就会得到一坨屎。这和你是否懂编程没关系,和你是否认真有关系。

    油管:https://www.youtube.com/@抡锤者

    Stoma StomaS 1 条回复 最后回复
    2
    • williamlouisW 离线
      williamlouisW 离线
      williamlouis
      超级版主
      编写于 最后由 编辑
      #5

      audio.cpp 可以试试。别人做的加强版本https://github.com/kigner/audio.cpp-webui。可以先看看原版。你的显卡有点低。加强版的作者都比你的卡高太多。原版你直接搜就可以了。在 GitHub。

      个人主页:xlkj.org Telegram https://t.me/xlkjorg

      Stoma StomaS 1 条回复 最后回复
      1
      • williamlouisW williamlouis

        audio.cpp 可以试试。别人做的加强版本https://github.com/kigner/audio.cpp-webui。可以先看看原版。你的显卡有点低。加强版的作者都比你的卡高太多。原版你直接搜就可以了。在 GitHub。

        Stoma StomaS 离线
        Stoma StomaS 离线
        Stoma Stoma
        编写于 最后由 编辑
        #6

        @terry 谢谢指导,现在立刻开始实践。


        @williamlouis 谢谢喂投,我先一口一口来。

        1 条回复 最后回复
        0
        • terryT terry

          @Stoma-Stoma VoxCPM毫无疑问是够用的,你可以尝试1.5版本,2.0我测试了,并无明显优势,而且还慢一些。口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。

          你把这段话贴给你的CC看,让它照着操作。另外参考声音你去找一个你喜欢的真人主播,或者其他你听过的,觉得拟真度比较高的AI语音,不要随便选AI语音,它的克隆很精准,你给一坨屎给它模仿,就会得到一坨屎。这和你是否懂编程没关系,和你是否认真有关系。

          Stoma StomaS 离线
          Stoma StomaS 离线
          Stoma Stoma
          编写于 最后由 编辑
          #7

          @terry
          前提不是帅锅
          我尽我的能力从昨天开始实践(”口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。“),倒腾到现在 claude code 给我下面的回复:


          台式A 装 Docker/Ubuntu 这条路,被「精简版」堵死了——需要你定夺怎么走

          ① 一句话说事
          你选 Docker/Ubuntu 是想绕开台式A 这套精简版 Windows。但有个隐藏的连环套:Docker Desktop 在 Windows 上并不是独立跑的,它底层骑在 WSL2 上;而 WSL2 需要「虚拟化平台」这个 Windows 组件——恰恰就是精简版被削掉、现在装不上的那个(dism 被换成了旧版 19041,启用任何系统组件都报「找不到路径」)。所以走
          Docker 和直接装 WSL2,卡在同一个坑里,没绕开。

          ② 不处理会怎样 / 为什么不能换个虚拟机
          你可能会想「那我用 VirtualBox/VMware 装 Ubuntu 不就行了」——能装,但那类虚拟机不能把 RTX3050 的 CUDA 传进 Ubuntu,VoxCPM 是靠显卡跑的,进去也用不了 GPU。在 Windows 上能让 Linux 用上这块显卡的,只有 WSL2 一条路(它有专门的 GPU 直通),而这条路被精简版堵了。换句话说:想在这台机器上「GPU + Linux」,绕不过修 Windows。

          ③ 三个选项

          • A(推荐,今天就能出克隆声音):不折腾虚拟化,直接在台式A 现成的 Windows Python 上给 VoxCPM 加降噪器 + 做克隆。刚测过——原生 CUDA 就绪(torch 2.5.1+cu121、RTX3050、voxcpm 可导入)。你要的降噪器(ModelScope ZipEnhancer)、克隆、缓存、段落长度控制全都能满足。唯一没满足的是「跑在 Linux 里」——而这条恰恰被精简版短期堵死了。0 新装、低风险、不碰系统。
            ▎ 注:这不是你排斥的「Windows 整合包」,是你自己那套干净 venv,我只在上面把降噪器打开、加克隆逻辑。
          • B(修 Windows 再走 WSL2/Docker):给 dism 指一个完整版 19045 安装源,把被削的服务栈补回来 → 启用虚拟化组件 → WSL2 → Docker。能满足「Linux」诉求,但精简版修复不确定,很可能要做到「就地重装」级别,有把这台日更生产机搞不稳的风险,耗时高,我不建议现在冒这个险。
          • C(并入后期换 Ubuntu):你本来就计划台式A 升级显卡时换原生 Ubuntu。原生 Ubuntu = 完整 CUDA + 真 Linux + 没这些坑,是「Linux 跑 TTS」最干净的归宿。把这个诉求并到那次迁移,现在先用 A 出活。

          我的台式机是兼容机操作系统 Win10 19045(装机商安装),
          昨天开始实践时 Claud code 让我人工来操作安装我就有点不理解,试了不行,
          又让 Hermes 干,它也提示需要人工操作,还是不行,我又强行让他干,还是不行
          最后强行让 Claud code 干,就出现以上结果。
          可能这是个坑,这些家伙全部让我跳进去折腾,来来回回一直折腾到还未果。


          目前纠结: 1、根据建议 修 Windows 再走 WSL2/Docker 风险大还影响日更生产线
          2、直接根据现有硬件换 Ubuntu 操作系统,风险大且未知生产线是否可以平移
          3、上新硬件新系统来折腾,经济和时间不划算
          纠结的前提是严格按要求来实践,不选择推荐的 A 方案。
          那么是否还有其它的路线能不换操作系统,不折腾硬件,同时也能风险小的实践。
          也有可能我实践的理解一开始就是错的,如果是请有空再指点!

          1 条回复 最后回复
          0
          • terryT 在线
            terryT 在线
            terry
            超级版主
            编写于 最后由 terry 编辑
            #8

            WSL2速度比windows原生快很多,我测试过,但音频生成是轻量任务,说实话,安装这个玩意其实很简单,何况你还有CC,如果这点任务都搞不定,你用CC干什么?它不是废物?实在不行建议你以后和我一样换到Hermes+DeepSeek,我的所有环境现在都是Hermes在维护,你看我的视频就知道了。就是安装VoxCPM这样的小环境是极度傻逼的日常任务,CC我想不至于这么废物吧。我今天还用它安装了新的ComfyUI环境,就很简单,我都很久没手动安装过环境了。

            鉴于你的情况,建议打开刘悦的技术博客,B站,下载VoxCPM,Qwen TTS的整合包,对了,最近它又发布了一个Windows下的什么语音整合包,你看他7月份发布的,效果够你用了,在Windows下点击鼠标就能跑。如果还是有问题,建议放弃本地AI,你不适合搞这个。在线的微软,谷歌,阿里的语音都挺好的,就是有敏感词审核。

            无论是2.0还是1.5,voxCPM还是Qwen或者其他TTS,只要量产一定会有停顿异常,需要脚本修复,就是你告诉AI,让AI写一个修复停顿异常的脚本,就这么简单。在线的也有,微软和谷歌都有,有时候还特别严重,但是大部分时候比本地要好,无需修正。这不存在指点不指点,我都明确告诉你我的生产环境,你要真想解决问题,上WSL2或者原生Linux,怎么会搞不定呢?你必须明白,克隆语音,没有任何AI能和VoxCPM相提并论,在线的也不行,这是技术路线决定的。

            油管:https://www.youtube.com/@抡锤者

            Stoma StomaS 1 条回复 最后回复
            1
            • williamlouisW 离线
              williamlouisW 离线
              williamlouis
              超级版主
              编写于 最后由 编辑
              #9

              很久前我就说过 Linux解决方案 桌面版 mint 就可以。安装过程比 Windows 还要简单。但是使用者寥寥。
              实在搞不懂和 Windows 这个闭源死克的原因何在呢?(其实我是反WEN 统治派的。一看Windows就火大。)

              个人主页:xlkj.org Telegram https://t.me/xlkjorg

              1 条回复 最后回复
              0
              • terryT terry

                WSL2速度比windows原生快很多,我测试过,但音频生成是轻量任务,说实话,安装这个玩意其实很简单,何况你还有CC,如果这点任务都搞不定,你用CC干什么?它不是废物?实在不行建议你以后和我一样换到Hermes+DeepSeek,我的所有环境现在都是Hermes在维护,你看我的视频就知道了。就是安装VoxCPM这样的小环境是极度傻逼的日常任务,CC我想不至于这么废物吧。我今天还用它安装了新的ComfyUI环境,就很简单,我都很久没手动安装过环境了。

                鉴于你的情况,建议打开刘悦的技术博客,B站,下载VoxCPM,Qwen TTS的整合包,对了,最近它又发布了一个Windows下的什么语音整合包,你看他7月份发布的,效果够你用了,在Windows下点击鼠标就能跑。如果还是有问题,建议放弃本地AI,你不适合搞这个。在线的微软,谷歌,阿里的语音都挺好的,就是有敏感词审核。

                无论是2.0还是1.5,voxCPM还是Qwen或者其他TTS,只要量产一定会有停顿异常,需要脚本修复,就是你告诉AI,让AI写一个修复停顿异常的脚本,就这么简单。在线的也有,微软和谷歌都有,有时候还特别严重,但是大部分时候比本地要好,无需修正。这不存在指点不指点,我都明确告诉你我的生产环境,你要真想解决问题,上WSL2或者原生Linux,怎么会搞不定呢?你必须明白,克隆语音,没有任何AI能和VoxCPM相提并论,在线的也不行,这是技术路线决定的。

                Stoma StomaS 离线
                Stoma StomaS 离线
                Stoma Stoma
                编写于 最后由 编辑
                #10

                @terry
                没有第一时间看到您回复。
                我昨天在跑其它任务时,挂机一晚上,其中这个任务也要用到 WSL2/Docker 环境(后面才晓得),CC 他搞定了:
                “- WSL2 本体健康:内核 2.9.4.0,docker-desktop 发行版状态 Running/WSL2,WSLService 服务在跑。

                • Docker 引擎在跑:docker version 返回 Client 29.6.1 / Server Docker Desktop 4.82.0,容器
                  pcos-db(pgvector/pg16)已稳定运行 4 小时,端口 5896 正常映射。”
                  结论:CC 不是一个废物,我是个 FW,CC 说什么我就信什么,有时就是让 CC 死搞就完事。

                我已用 Windows Python 环境,把你的给我的提示词”口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。“直接甩过去给 CC 用 VoxCPM 克隆出能用的语音了,谢谢。


                我是技术小白,也听从建议从 CC 切换到 Hermes+DeepSeek 但前期 Hermes+DeepSeek 有些蠢,还有些抽筋,活干得没有 CC 满意。
                听人听劝,有饭吃。Hermes+DeepSeek 要逐步切换过去,但目前还没有找到合适的途经和方法。


                声音克隆出来了,声音后期要配背景音乐还有什么开场音乐、转场音乐、最后还有什么收尾音乐。
                道道难关,关关要过!这道关,如何过?


                顺带记录一下:
                现在做的内容涉及到本地模型和云端模型分工的问题。
                这二天在做本地模型的输出内容质量校对,从在本地模型的提示词上花费了不少时间,后面发现云端能解决输出质量的问题。对本地模型在我这个任务的能力的边界有了新的认识。
                思考:可能所谓的懂技术,只不过通过时间转化为少花费 Token。

                1 条回复 最后回复
                0
                • Q mariaQ 在线
                  Q mariaQ 在线
                  Q maria
                  劳动模范 技术大牛
                  编写于 最后由 编辑
                  #11

                  我是每段不让它超过30秒,发现25秒左右效果比较稳定。不过有感情的模特每段的声线会有所差异,这是比较难搞的。得选一个平读的模特

                  L 1 条回复 最后回复
                  0
                  • smilaryS 离线
                    smilaryS 离线
                    smilary
                    编写于 最后由 编辑
                    #12

                    小白成长之路,幸运的是有AI agent,效率会高很多

                    1 条回复 最后回复
                    0
                    • williamlouisW 离线
                      williamlouisW 离线
                      williamlouis
                      超级版主
                      编写于 最后由 编辑
                      #13

                      对于 死磕 windows ,我只好不说什么了。你的逻辑思路一直是BUG状态。只能你自己修复。

                      个人主页:xlkj.org Telegram https://t.me/xlkjorg

                      1 条回复 最后回复
                      0
                      • Q mariaQ Q maria

                        我是每段不让它超过30秒,发现25秒左右效果比较稳定。不过有感情的模特每段的声线会有所差异,这是比较难搞的。得选一个平读的模特

                        L 离线
                        L 离线
                        laobenxiong
                        德高望重 劳动模范
                        编写于 最后由 编辑
                        #14

                        @Q-maria 嗯, 我是把文本限制在500个字符. 时间长了, 语速原来越快, 噪音也增加. 不懂为啥.

                        1 条回复 最后回复
                        0
                        • L 离线
                          L 离线
                          laobenxiong
                          德高望重 劳动模范
                          编写于 最后由 编辑
                          #15

                          dialog.py
                          README.md

                          FYI: README.md 是我安装 VoxCPM 1.5 的记录; dialog.py 是用来生成两人对话 mp3 的脚本. 主要是hermes+qwen2.6-27B帮忙试出来的. 用的是 16G 的 N 卡. 效果还行. 我刚开始弄的时候把事情想得太简单, 实际过程发现还是要了解一些细节才行. 一键生成---还是太理想了.

                          1 条回复 最后回复
                          0

                          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                          有了你的建议,这篇帖子会更精彩哦 💗

                          注册 登录
                          回复
                          • 在新帖中回复
                          登录后回复
                          • 从旧到新
                          • 从新到旧
                          • 最多赞同


                          • 登录

                          • 没有帐号? 注册

                          • 登录或注册以进行搜索。
                          • 第一个帖子
                            最后一个帖子
                          0
                          • 版块
                          • 最新
                          • 标签
                          • 热门
                          • 用户
                          • 群组