跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. AI音视频画图
  3. 求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!

求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!

已定时 已固定 已锁定 已移动 AI音视频画图
15 帖子 8 发布者 351 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • williamlouisW 离线
    williamlouisW 离线
    williamlouis
    超级版主
    编写于 最后由 编辑
    #5

    audio.cpp 可以试试。别人做的加强版本https://github.com/kigner/audio.cpp-webui。可以先看看原版。你的显卡有点低。加强版的作者都比你的卡高太多。原版你直接搜就可以了。在 GitHub。

    个人主页:xlkj.org Telegram https://t.me/xlkjorg

    Stoma StomaS 1 条回复 最后回复
    1
    • williamlouisW williamlouis

      audio.cpp 可以试试。别人做的加强版本https://github.com/kigner/audio.cpp-webui。可以先看看原版。你的显卡有点低。加强版的作者都比你的卡高太多。原版你直接搜就可以了。在 GitHub。

      Stoma StomaS 离线
      Stoma StomaS 离线
      Stoma Stoma
      编写于 最后由 编辑
      #6

      @terry 谢谢指导,现在立刻开始实践。


      @williamlouis 谢谢喂投,我先一口一口来。

      1 条回复 最后回复
      0
      • terryT terry

        @Stoma-Stoma VoxCPM毫无疑问是够用的,你可以尝试1.5版本,2.0我测试了,并无明显优势,而且还慢一些。口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。

        你把这段话贴给你的CC看,让它照着操作。另外参考声音你去找一个你喜欢的真人主播,或者其他你听过的,觉得拟真度比较高的AI语音,不要随便选AI语音,它的克隆很精准,你给一坨屎给它模仿,就会得到一坨屎。这和你是否懂编程没关系,和你是否认真有关系。

        Stoma StomaS 离线
        Stoma StomaS 离线
        Stoma Stoma
        编写于 最后由 编辑
        #7

        @terry
        前提不是帅锅
        我尽我的能力从昨天开始实践(”口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。“),倒腾到现在 claude code 给我下面的回复:


        台式A 装 Docker/Ubuntu 这条路,被「精简版」堵死了——需要你定夺怎么走

        ① 一句话说事
        你选 Docker/Ubuntu 是想绕开台式A 这套精简版 Windows。但有个隐藏的连环套:Docker Desktop 在 Windows 上并不是独立跑的,它底层骑在 WSL2 上;而 WSL2 需要「虚拟化平台」这个 Windows 组件——恰恰就是精简版被削掉、现在装不上的那个(dism 被换成了旧版 19041,启用任何系统组件都报「找不到路径」)。所以走
        Docker 和直接装 WSL2,卡在同一个坑里,没绕开。

        ② 不处理会怎样 / 为什么不能换个虚拟机
        你可能会想「那我用 VirtualBox/VMware 装 Ubuntu 不就行了」——能装,但那类虚拟机不能把 RTX3050 的 CUDA 传进 Ubuntu,VoxCPM 是靠显卡跑的,进去也用不了 GPU。在 Windows 上能让 Linux 用上这块显卡的,只有 WSL2 一条路(它有专门的 GPU 直通),而这条路被精简版堵了。换句话说:想在这台机器上「GPU + Linux」,绕不过修 Windows。

        ③ 三个选项

        • A(推荐,今天就能出克隆声音):不折腾虚拟化,直接在台式A 现成的 Windows Python 上给 VoxCPM 加降噪器 + 做克隆。刚测过——原生 CUDA 就绪(torch 2.5.1+cu121、RTX3050、voxcpm 可导入)。你要的降噪器(ModelScope ZipEnhancer)、克隆、缓存、段落长度控制全都能满足。唯一没满足的是「跑在 Linux 里」——而这条恰恰被精简版短期堵死了。0 新装、低风险、不碰系统。
          ▎ 注:这不是你排斥的「Windows 整合包」,是你自己那套干净 venv,我只在上面把降噪器打开、加克隆逻辑。
        • B(修 Windows 再走 WSL2/Docker):给 dism 指一个完整版 19045 安装源,把被削的服务栈补回来 → 启用虚拟化组件 → WSL2 → Docker。能满足「Linux」诉求,但精简版修复不确定,很可能要做到「就地重装」级别,有把这台日更生产机搞不稳的风险,耗时高,我不建议现在冒这个险。
        • C(并入后期换 Ubuntu):你本来就计划台式A 升级显卡时换原生 Ubuntu。原生 Ubuntu = 完整 CUDA + 真 Linux + 没这些坑,是「Linux 跑 TTS」最干净的归宿。把这个诉求并到那次迁移,现在先用 A 出活。

        我的台式机是兼容机操作系统 Win10 19045(装机商安装),
        昨天开始实践时 Claud code 让我人工来操作安装我就有点不理解,试了不行,
        又让 Hermes 干,它也提示需要人工操作,还是不行,我又强行让他干,还是不行
        最后强行让 Claud code 干,就出现以上结果。
        可能这是个坑,这些家伙全部让我跳进去折腾,来来回回一直折腾到还未果。


        目前纠结: 1、根据建议 修 Windows 再走 WSL2/Docker 风险大还影响日更生产线
        2、直接根据现有硬件换 Ubuntu 操作系统,风险大且未知生产线是否可以平移
        3、上新硬件新系统来折腾,经济和时间不划算
        纠结的前提是严格按要求来实践,不选择推荐的 A 方案。
        那么是否还有其它的路线能不换操作系统,不折腾硬件,同时也能风险小的实践。
        也有可能我实践的理解一开始就是错的,如果是请有空再指点!

        1 条回复 最后回复
        0
        • terryT 离线
          terryT 离线
          terry
          超级版主
          编写于 最后由 terry 编辑
          #8

          WSL2速度比windows原生快很多,我测试过,但音频生成是轻量任务,说实话,安装这个玩意其实很简单,何况你还有CC,如果这点任务都搞不定,你用CC干什么?它不是废物?实在不行建议你以后和我一样换到Hermes+DeepSeek,我的所有环境现在都是Hermes在维护,你看我的视频就知道了。就是安装VoxCPM这样的小环境是极度傻逼的日常任务,CC我想不至于这么废物吧。我今天还用它安装了新的ComfyUI环境,就很简单,我都很久没手动安装过环境了。

          鉴于你的情况,建议打开刘悦的技术博客,B站,下载VoxCPM,Qwen TTS的整合包,对了,最近它又发布了一个Windows下的什么语音整合包,你看他7月份发布的,效果够你用了,在Windows下点击鼠标就能跑。如果还是有问题,建议放弃本地AI,你不适合搞这个。在线的微软,谷歌,阿里的语音都挺好的,就是有敏感词审核。

          无论是2.0还是1.5,voxCPM还是Qwen或者其他TTS,只要量产一定会有停顿异常,需要脚本修复,就是你告诉AI,让AI写一个修复停顿异常的脚本,就这么简单。在线的也有,微软和谷歌都有,有时候还特别严重,但是大部分时候比本地要好,无需修正。这不存在指点不指点,我都明确告诉你我的生产环境,你要真想解决问题,上WSL2或者原生Linux,怎么会搞不定呢?你必须明白,克隆语音,没有任何AI能和VoxCPM相提并论,在线的也不行,这是技术路线决定的。

          油管:https://www.youtube.com/@抡锤者

          Stoma StomaS 1 条回复 最后回复
          1
          • williamlouisW 离线
            williamlouisW 离线
            williamlouis
            超级版主
            编写于 最后由 编辑
            #9

            很久前我就说过 Linux解决方案 桌面版 mint 就可以。安装过程比 Windows 还要简单。但是使用者寥寥。
            实在搞不懂和 Windows 这个闭源死克的原因何在呢?(其实我是反WEN 统治派的。一看Windows就火大。)

            个人主页:xlkj.org Telegram https://t.me/xlkjorg

            1 条回复 最后回复
            0
            • terryT terry

              WSL2速度比windows原生快很多,我测试过,但音频生成是轻量任务,说实话,安装这个玩意其实很简单,何况你还有CC,如果这点任务都搞不定,你用CC干什么?它不是废物?实在不行建议你以后和我一样换到Hermes+DeepSeek,我的所有环境现在都是Hermes在维护,你看我的视频就知道了。就是安装VoxCPM这样的小环境是极度傻逼的日常任务,CC我想不至于这么废物吧。我今天还用它安装了新的ComfyUI环境,就很简单,我都很久没手动安装过环境了。

              鉴于你的情况,建议打开刘悦的技术博客,B站,下载VoxCPM,Qwen TTS的整合包,对了,最近它又发布了一个Windows下的什么语音整合包,你看他7月份发布的,效果够你用了,在Windows下点击鼠标就能跑。如果还是有问题,建议放弃本地AI,你不适合搞这个。在线的微软,谷歌,阿里的语音都挺好的,就是有敏感词审核。

              无论是2.0还是1.5,voxCPM还是Qwen或者其他TTS,只要量产一定会有停顿异常,需要脚本修复,就是你告诉AI,让AI写一个修复停顿异常的脚本,就这么简单。在线的也有,微软和谷歌都有,有时候还特别严重,但是大部分时候比本地要好,无需修正。这不存在指点不指点,我都明确告诉你我的生产环境,你要真想解决问题,上WSL2或者原生Linux,怎么会搞不定呢?你必须明白,克隆语音,没有任何AI能和VoxCPM相提并论,在线的也不行,这是技术路线决定的。

              Stoma StomaS 离线
              Stoma StomaS 离线
              Stoma Stoma
              编写于 最后由 编辑
              #10

              @terry
              没有第一时间看到您回复。
              我昨天在跑其它任务时,挂机一晚上,其中这个任务也要用到 WSL2/Docker 环境(后面才晓得),CC 他搞定了:
              “- WSL2 本体健康:内核 2.9.4.0,docker-desktop 发行版状态 Running/WSL2,WSLService 服务在跑。

              • Docker 引擎在跑:docker version 返回 Client 29.6.1 / Server Docker Desktop 4.82.0,容器
                pcos-db(pgvector/pg16)已稳定运行 4 小时,端口 5896 正常映射。”
                结论:CC 不是一个废物,我是个 FW,CC 说什么我就信什么,有时就是让 CC 死搞就完事。

              我已用 Windows Python 环境,把你的给我的提示词”口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。“直接甩过去给 CC 用 VoxCPM 克隆出能用的语音了,谢谢。


              我是技术小白,也听从建议从 CC 切换到 Hermes+DeepSeek 但前期 Hermes+DeepSeek 有些蠢,还有些抽筋,活干得没有 CC 满意。
              听人听劝,有饭吃。Hermes+DeepSeek 要逐步切换过去,但目前还没有找到合适的途经和方法。


              声音克隆出来了,声音后期要配背景音乐还有什么开场音乐、转场音乐、最后还有什么收尾音乐。
              道道难关,关关要过!这道关,如何过?


              顺带记录一下:
              现在做的内容涉及到本地模型和云端模型分工的问题。
              这二天在做本地模型的输出内容质量校对,从在本地模型的提示词上花费了不少时间,后面发现云端能解决输出质量的问题。对本地模型在我这个任务的能力的边界有了新的认识。
              思考:可能所谓的懂技术,只不过通过时间转化为少花费 Token。

              1 条回复 最后回复
              0
              • Q mariaQ 离线
                Q mariaQ 离线
                Q maria
                劳动模范 技术大牛
                编写于 最后由 编辑
                #11

                我是每段不让它超过30秒,发现25秒左右效果比较稳定。不过有感情的模特每段的声线会有所差异,这是比较难搞的。得选一个平读的模特

                L 1 条回复 最后回复
                0
                • smilaryS 离线
                  smilaryS 离线
                  smilary
                  编写于 最后由 编辑
                  #12

                  小白成长之路,幸运的是有AI agent,效率会高很多

                  1 条回复 最后回复
                  0
                  • williamlouisW 离线
                    williamlouisW 离线
                    williamlouis
                    超级版主
                    编写于 最后由 编辑
                    #13

                    对于 死磕 windows ,我只好不说什么了。你的逻辑思路一直是BUG状态。只能你自己修复。

                    个人主页:xlkj.org Telegram https://t.me/xlkjorg

                    1 条回复 最后回复
                    0
                    • Q mariaQ Q maria

                      我是每段不让它超过30秒,发现25秒左右效果比较稳定。不过有感情的模特每段的声线会有所差异,这是比较难搞的。得选一个平读的模特

                      L 离线
                      L 离线
                      laobenxiong
                      德高望重 劳动模范
                      编写于 最后由 编辑
                      #14

                      @Q-maria 嗯, 我是把文本限制在500个字符. 时间长了, 语速原来越快, 噪音也增加. 不懂为啥.

                      1 条回复 最后回复
                      0
                      • L 离线
                        L 离线
                        laobenxiong
                        德高望重 劳动模范
                        编写于 最后由 编辑
                        #15

                        dialog.py
                        README.md

                        FYI: README.md 是我安装 VoxCPM 1.5 的记录; dialog.py 是用来生成两人对话 mp3 的脚本. 主要是hermes+qwen2.6-27B帮忙试出来的. 用的是 16G 的 N 卡. 效果还行. 我刚开始弄的时候把事情想得太简单, 实际过程发现还是要了解一些细节才行. 一键生成---还是太理想了.

                        1 条回复 最后回复
                        0

                        你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                        厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                        有了你的建议,这篇帖子会更精彩哦 💗

                        注册 登录
                        回复
                        • 在新帖中回复
                        登录后回复
                        • 从旧到新
                        • 从新到旧
                        • 最多赞同


                        • 登录

                        • 没有帐号? 注册

                        • 登录或注册以进行搜索。
                        • 第一个帖子
                          最后一个帖子
                        0
                        • 版块
                        • 最新
                        • 标签
                        • 热门
                        • 用户
                        • 群组