跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI音视频画图
  4. VoxCPM2 語音克隆 TTS 生成音色不穩定

VoxCPM2 語音克隆 TTS 生成音色不穩定

已定时 已固定 已锁定 已移动 AI音视频画图
macttsvoxcpm
28 帖子 9 发布者 1.3k 浏览 1 关注中
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • L linax777

    @0xsltomorrow Ultimate Clone 沒試過太多次
    使用 HTTP API 調用 生成幾次之後就變成隨機音色 女聲變男聲
    再試幾天沒有改善可能要換成使用 Qwen3-TTS

    terryT 离线
    terryT 离线
    terry
    超级版主
    发表于 最后由 编辑
    #11

    @linax777 voxcpm是流式API,你可以分段的,音频可以用ffpmeg代码修理,qwen TTS 在克隆方面远不如voxcpm,它的优势是多音色。

    油管:https://www.youtube.com/@抡锤者

    1 条回复 最后回复
    0
    • ? 离线
      ? 离线
      老用户
      发表于 最后由 编辑
      #12

      我是才开始接触AI音视频,综合对比了一下,我用的刘悦大神的QWEN TTS 1.7B文字转语音整合包,除了长篇幅几千字会出现吞字外,感觉音频质量还是在线的。而且你是不是参考语音片段太长了,都1分钟了,一般不都是10秒左右吗?

      terryT 1 条回复 最后回复
      0
      • ? 老用户

        我是才开始接触AI音视频,综合对比了一下,我用的刘悦大神的QWEN TTS 1.7B文字转语音整合包,除了长篇幅几千字会出现吞字外,感觉音频质量还是在线的。而且你是不是参考语音片段太长了,都1分钟了,一般不都是10秒左右吗?

        terryT 离线
        terryT 离线
        terry
        超级版主
        发表于 最后由 编辑
        #13

        @t68823878 刘悦的包好不好用,我下载了,没怎么测试,主要是voxcpm太好用了,发个帖子分享下啊,付出一点。

        油管:https://www.youtube.com/@抡锤者

        ? 1 条回复 最后回复
        0
        • 0xsltomorrow0 0xsltomorrow

          @terry 2.0 可以抽卡設計音色 但不一定抽到好卡
          另外增加了日語、韓語及多種方言支援 (其他方言我不懂,但日、韓、粵語聽起來都是怪怪的)

          terryT 离线
          terryT 离线
          terry
          超级版主
          发表于 最后由 编辑
          #14

          @0xsltomorrow 多谢,那意义不大,我不想升级。1.5挺好的,我只做中英文,我感觉够强了,过犹不及。

          油管:https://www.youtube.com/@抡锤者

          0xsltomorrow0 1 条回复 最后回复
          0
          • terryT terry

            @t68823878 刘悦的包好不好用,我下载了,没怎么测试,主要是voxcpm太好用了,发个帖子分享下啊,付出一点。

            ? 离线
            ? 离线
            老用户
            发表于 最后由 编辑
            #15

            @terry 就是挺简单根据刘悦那个视频教程来就行了,https://www.youtube.com/watch?v=HUPxh1sCDpA
            主要优势就是声音比较自然,AI味不明显,用来设计音色也是很不错的,我弄的语音音色就是用它抽卡抽出来的;
            当然我也试了用comfyui工作流来QWEN3 TTS,出来的效果比不上整合包,具体原因我也没有深入研究,整合包出来效果就是要好很多。

            terryT 1 条回复 最后回复
            0
            • ? 老用户

              @terry 就是挺简单根据刘悦那个视频教程来就行了,https://www.youtube.com/watch?v=HUPxh1sCDpA
              主要优势就是声音比较自然,AI味不明显,用来设计音色也是很不错的,我弄的语音音色就是用它抽卡抽出来的;
              当然我也试了用comfyui工作流来QWEN3 TTS,出来的效果比不上整合包,具体原因我也没有深入研究,整合包出来效果就是要好很多。

              terryT 离线
              terryT 离线
              terry
              超级版主
              发表于 最后由 编辑
              #16

              @t68823878 不要用comfyui部署,直接在linux下就可以部署Qwen TTS, 改天我测试下,上次我记得跑过整合包,稍微体验了下。过几天试试看。

              油管:https://www.youtube.com/@抡锤者

              1 条回复 最后回复
              0
              • terryT terry

                @0xsltomorrow 多谢,那意义不大,我不想升级。1.5挺好的,我只做中英文,我感觉够强了,过犹不及。

                0xsltomorrow0 离线
                0xsltomorrow0 离线
                0xsltomorrow
                发表于 最后由 编辑
                #17

                @terry 對啊 我選他主要是可以本地運行廣東話TTS
                而且音色不像Elevenlabs 有點機械音的感覺
                用幾十分鐘的內容訓練個LoRa就連上面講會走音的問題也秒殺掉
                但有些字他總是讀錯 還在研究怎樣解決 哈

                1 条回复 最后回复
                1
                • 张老师张 离线
                  张老师张 离线
                  张老师
                  劳动模范 德高望重
                  发表于 最后由 编辑
                  #18

                  e480ef84-2116-4dd5-a373-667a283a1ad3-image.jpeg
                  c892e235-3ff2-438b-adea-a38b39db3871-image.jpeg
                  刚刚前几天做了这个项目,我对它进行了很多的魔改,当时也遇到了克隆声音效果不好,必须把参数调得很高,那样的话渲染的时间又很长!
                  然后通过音色设计,抽卡一个比较靠谱的声音,记住它的种子号!然后又遇到了长文爆显存,后来就变成了分段渲染(刚好可以修改不满意的部分,而不用整段渲染),但是分段渲染,又遇到了同一个种子声音发出了不同的声音!最后想了一个办法,分段渲染时,先渲染一段相同的语句作为参考点(不显示)强制让它分段渲染的声音一致!反正这个项目折腾了很久!总算可以商用的版本!

                  terryT 1 条回复 最后回复
                  1
                  • 张老师张 张老师

                    e480ef84-2116-4dd5-a373-667a283a1ad3-image.jpeg
                    c892e235-3ff2-438b-adea-a38b39db3871-image.jpeg
                    刚刚前几天做了这个项目,我对它进行了很多的魔改,当时也遇到了克隆声音效果不好,必须把参数调得很高,那样的话渲染的时间又很长!
                    然后通过音色设计,抽卡一个比较靠谱的声音,记住它的种子号!然后又遇到了长文爆显存,后来就变成了分段渲染(刚好可以修改不满意的部分,而不用整段渲染),但是分段渲染,又遇到了同一个种子声音发出了不同的声音!最后想了一个办法,分段渲染时,先渲染一段相同的语句作为参考点(不显示)强制让它分段渲染的声音一致!反正这个项目折腾了很久!总算可以商用的版本!

                    terryT 离线
                    terryT 离线
                    terry
                    超级版主
                    发表于 最后由 编辑
                    #19

                    @张老师 你试试看Linux,wsl2都比它快很多,我4090能跑到50t/s,xtx 20t/s,你看看你的日志对比下就知道了,voxcpm的win整合包一般速读哦堵很慢。

                    油管:https://www.youtube.com/@抡锤者

                    张老师张 1 条回复 最后回复
                    0
                    • terryT terry

                      @张老师 你试试看Linux,wsl2都比它快很多,我4090能跑到50t/s,xtx 20t/s,你看看你的日志对比下就知道了,voxcpm的win整合包一般速读哦堵很慢。

                      张老师张 离线
                      张老师张 离线
                      张老师
                      劳动模范 德高望重
                      发表于 最后由 张老师 编辑
                      #20

                      @terry 大神好,感谢回复,目前我这套模式还可以接受1:3的比例吧,一分钟,3分钟时间渲染!至于到其他系统里面去折腾,等我也去旁边医院里问一下我的一个肾值多少钱,是否能买下4090 48G的显卡!买了显卡我再去折腾吧!哈哈

                      terryT 1 条回复 最后回复
                      0
                      • 张老师张 张老师

                        @terry 大神好,感谢回复,目前我这套模式还可以接受1:3的比例吧,一分钟,3分钟时间渲染!至于到其他系统里面去折腾,等我也去旁边医院里问一下我的一个肾值多少钱,是否能买下4090 48G的显卡!买了显卡我再去折腾吧!哈哈

                        terryT 离线
                        terryT 离线
                        terry
                        超级版主
                        发表于 最后由 编辑
                        #21

                        @张老师 那挺慢的,你换Linux就能快点。不需要卖肾。

                        油管:https://www.youtube.com/@抡锤者

                        张老师张 1 条回复 最后回复
                        0
                        • terryT terry

                          @张老师 那挺慢的,你换Linux就能快点。不需要卖肾。

                          张老师张 离线
                          张老师张 离线
                          张老师
                          劳动模范 德高望重
                          发表于 最后由 编辑
                          #22

                          @terry 说:

                          不需要卖肾。

                          哈哈,学你视频里幽默的方式,好的,我有空了去搞个洋垃圾组合也试试Ubuntu 服务器吧!到时候过来分享哦

                          terryT 1 条回复 最后回复
                          0
                          • 张老师张 张老师

                            @terry 说:

                            不需要卖肾。

                            哈哈,学你视频里幽默的方式,好的,我有空了去搞个洋垃圾组合也试试Ubuntu 服务器吧!到时候过来分享哦

                            terryT 离线
                            terryT 离线
                            terry
                            超级版主
                            发表于 最后由 编辑
                            #23

                            @张老师 主力工作机器不要和AI部署机器放到一起是对的,你就给显卡配置个洋垃圾,让它独立运行,使劲造,坏了就重装。思路是对的。

                            油管:https://www.youtube.com/@抡锤者

                            1 条回复 最后回复
                            1
                            • Z 离线
                              Z 离线
                              zeroxin
                              发表于 最后由 编辑
                              #24

                              我所有的电脑都是洋垃圾E5平台,一台是5070TI 128G内存,一台3060 12G+64内存,一台2070 8G+32G内存,前两台跑龙虾+comfyui ,第三台只能办公了

                              1 条回复 最后回复
                              1
                              • W 离线
                                W 离线
                                weidong
                                发表于 最后由 编辑
                                #25

                                我觉得indextts挺好用的,在苹果下生成速度还过得去

                                1 条回复 最后回复
                                0
                                • Y 离线
                                  Y 离线
                                  youtubevic
                                  发表于 最后由 编辑
                                  #26

                                  請問怎樣可以 給Hermes 妹妹發聲啊? 他每次都要調用VOXCPM v2?

                                  kop wangK 1 条回复 最后回复
                                  0
                                  • Y youtubevic

                                    請問怎樣可以 給Hermes 妹妹發聲啊? 他每次都要調用VOXCPM v2?

                                    kop wangK 离线
                                    kop wangK 离线
                                    kop wang
                                    超级版主
                                    发表于 最后由 编辑
                                    #27

                                    @youtubevic Hermes的TTS有几条路径。
                                    1、Hermes官方支持的接口。比如微软的本地EDGE TTS,免费,性能超好。代价就是一耳朵机器人味。
                                    2、用第三方模型,比如楼主介绍的,或者我的方案:https://lcz.me/topic/116/hermes-tts-语音回复-discord语音频道交互-本地搭建分享-4gb显存要求
                                    3、自己接的第三方API,可以通过skill让Hermes调用。

                                    虚心交流,一起进步

                                    1 条回复 最后回复
                                    0
                                    • Y 离线
                                      Y 离线
                                      youtubevic
                                      发表于 最后由 编辑
                                      #28

                                      感謝幫忙介紹 。謝謝

                                      1 条回复 最后回复
                                      0

                                      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                      有了你的建议,这篇帖子会更精彩哦 💗

                                      注册 登录
                                      回复
                                      • 在新帖中回复
                                      登录后回复
                                      • 从旧到新
                                      • 从新到旧
                                      • 最多赞同


                                      • 登录

                                      • 登录或注册以进行搜索。
                                      • 第一个帖子
                                        最后一个帖子
                                      0
                                      • 版块
                                      • 最新
                                      • 标签
                                      • 热门
                                      • 用户
                                      • 群组