求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!
-
audio.cpp 可以试试。别人做的加强版本https://github.com/kigner/audio.cpp-webui。可以先看看原版。你的显卡有点低。加强版的作者都比你的卡高太多。原版你直接搜就可以了。在 GitHub。
-
@Stoma-Stoma VoxCPM毫无疑问是够用的,你可以尝试1.5版本,2.0我测试了,并无明显优势,而且还慢一些。口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。
你把这段话贴给你的CC看,让它照着操作。另外参考声音你去找一个你喜欢的真人主播,或者其他你听过的,觉得拟真度比较高的AI语音,不要随便选AI语音,它的克隆很精准,你给一坨屎给它模仿,就会得到一坨屎。这和你是否懂编程没关系,和你是否认真有关系。
@terry
前提不是帅锅
我尽我的能力从昨天开始实践(”口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。“),倒腾到现在 claude code 给我下面的回复:
台式A 装 Docker/Ubuntu 这条路,被「精简版」堵死了——需要你定夺怎么走
① 一句话说事
你选 Docker/Ubuntu 是想绕开台式A 这套精简版 Windows。但有个隐藏的连环套:Docker Desktop 在 Windows 上并不是独立跑的,它底层骑在 WSL2 上;而 WSL2 需要「虚拟化平台」这个 Windows 组件——恰恰就是精简版被削掉、现在装不上的那个(dism 被换成了旧版 19041,启用任何系统组件都报「找不到路径」)。所以走
Docker 和直接装 WSL2,卡在同一个坑里,没绕开。② 不处理会怎样 / 为什么不能换个虚拟机
你可能会想「那我用 VirtualBox/VMware 装 Ubuntu 不就行了」——能装,但那类虚拟机不能把 RTX3050 的 CUDA 传进 Ubuntu,VoxCPM 是靠显卡跑的,进去也用不了 GPU。在 Windows 上能让 Linux 用上这块显卡的,只有 WSL2 一条路(它有专门的 GPU 直通),而这条路被精简版堵了。换句话说:想在这台机器上「GPU + Linux」,绕不过修 Windows。③ 三个选项
- A(推荐,今天就能出克隆声音):不折腾虚拟化,直接在台式A 现成的 Windows Python 上给 VoxCPM 加降噪器 + 做克隆。刚测过——原生 CUDA 就绪(torch 2.5.1+cu121、RTX3050、voxcpm 可导入)。你要的降噪器(ModelScope ZipEnhancer)、克隆、缓存、段落长度控制全都能满足。唯一没满足的是「跑在 Linux 里」——而这条恰恰被精简版短期堵死了。0 新装、低风险、不碰系统。
▎ 注:这不是你排斥的「Windows 整合包」,是你自己那套干净 venv,我只在上面把降噪器打开、加克隆逻辑。 - B(修 Windows 再走 WSL2/Docker):给 dism 指一个完整版 19045 安装源,把被削的服务栈补回来 → 启用虚拟化组件 → WSL2 → Docker。能满足「Linux」诉求,但精简版修复不确定,很可能要做到「就地重装」级别,有把这台日更生产机搞不稳的风险,耗时高,我不建议现在冒这个险。
- C(并入后期换 Ubuntu):你本来就计划台式A 升级显卡时换原生 Ubuntu。原生 Ubuntu = 完整 CUDA + 真 Linux + 没这些坑,是「Linux 跑 TTS」最干净的归宿。把这个诉求并到那次迁移,现在先用 A 出活。
我的台式机是兼容机操作系统 Win10 19045(装机商安装),
昨天开始实践时 Claud code 让我人工来操作安装我就有点不理解,试了不行,
又让 Hermes 干,它也提示需要人工操作,还是不行,我又强行让他干,还是不行
最后强行让 Claud code 干,就出现以上结果。
可能这是个坑,这些家伙全部让我跳进去折腾,来来回回一直折腾到还未果。
目前纠结: 1、根据建议 修 Windows 再走 WSL2/Docker 风险大还影响日更生产线
2、直接根据现有硬件换 Ubuntu 操作系统,风险大且未知生产线是否可以平移
3、上新硬件新系统来折腾,经济和时间不划算
纠结的前提是严格按要求来实践,不选择推荐的 A 方案。
那么是否还有其它的路线能不换操作系统,不折腾硬件,同时也能风险小的实践。
也有可能我实践的理解一开始就是错的,如果是请有空再指点! - A(推荐,今天就能出克隆声音):不折腾虚拟化,直接在台式A 现成的 Windows Python 上给 VoxCPM 加降噪器 + 做克隆。刚测过——原生 CUDA 就绪(torch 2.5.1+cu121、RTX3050、voxcpm 可导入)。你要的降噪器(ModelScope ZipEnhancer)、克隆、缓存、段落长度控制全都能满足。唯一没满足的是「跑在 Linux 里」——而这条恰恰被精简版短期堵死了。0 新装、低风险、不碰系统。
-
WSL2速度比windows原生快很多,我测试过,但音频生成是轻量任务,说实话,安装这个玩意其实很简单,何况你还有CC,如果这点任务都搞不定,你用CC干什么?它不是废物?实在不行建议你以后和我一样换到Hermes+DeepSeek,我的所有环境现在都是Hermes在维护,你看我的视频就知道了。就是安装VoxCPM这样的小环境是极度傻逼的日常任务,CC我想不至于这么废物吧。我今天还用它安装了新的ComfyUI环境,就很简单,我都很久没手动安装过环境了。
鉴于你的情况,建议打开刘悦的技术博客,B站,下载VoxCPM,Qwen TTS的整合包,对了,最近它又发布了一个Windows下的什么语音整合包,你看他7月份发布的,效果够你用了,在Windows下点击鼠标就能跑。如果还是有问题,建议放弃本地AI,你不适合搞这个。在线的微软,谷歌,阿里的语音都挺好的,就是有敏感词审核。
无论是2.0还是1.5,voxCPM还是Qwen或者其他TTS,只要量产一定会有停顿异常,需要脚本修复,就是你告诉AI,让AI写一个修复停顿异常的脚本,就这么简单。在线的也有,微软和谷歌都有,有时候还特别严重,但是大部分时候比本地要好,无需修正。这不存在指点不指点,我都明确告诉你我的生产环境,你要真想解决问题,上WSL2或者原生Linux,怎么会搞不定呢?你必须明白,克隆语音,没有任何AI能和VoxCPM相提并论,在线的也不行,这是技术路线决定的。
-
很久前我就说过 Linux解决方案 桌面版 mint 就可以。安装过程比 Windows 还要简单。但是使用者寥寥。
实在搞不懂和 Windows 这个闭源死克的原因何在呢?(其实我是反WEN 统治派的。一看Windows就火大。) -
WSL2速度比windows原生快很多,我测试过,但音频生成是轻量任务,说实话,安装这个玩意其实很简单,何况你还有CC,如果这点任务都搞不定,你用CC干什么?它不是废物?实在不行建议你以后和我一样换到Hermes+DeepSeek,我的所有环境现在都是Hermes在维护,你看我的视频就知道了。就是安装VoxCPM这样的小环境是极度傻逼的日常任务,CC我想不至于这么废物吧。我今天还用它安装了新的ComfyUI环境,就很简单,我都很久没手动安装过环境了。
鉴于你的情况,建议打开刘悦的技术博客,B站,下载VoxCPM,Qwen TTS的整合包,对了,最近它又发布了一个Windows下的什么语音整合包,你看他7月份发布的,效果够你用了,在Windows下点击鼠标就能跑。如果还是有问题,建议放弃本地AI,你不适合搞这个。在线的微软,谷歌,阿里的语音都挺好的,就是有敏感词审核。
无论是2.0还是1.5,voxCPM还是Qwen或者其他TTS,只要量产一定会有停顿异常,需要脚本修复,就是你告诉AI,让AI写一个修复停顿异常的脚本,就这么简单。在线的也有,微软和谷歌都有,有时候还特别严重,但是大部分时候比本地要好,无需修正。这不存在指点不指点,我都明确告诉你我的生产环境,你要真想解决问题,上WSL2或者原生Linux,怎么会搞不定呢?你必须明白,克隆语音,没有任何AI能和VoxCPM相提并论,在线的也不行,这是技术路线决定的。
@terry
没有第一时间看到您回复。
我昨天在跑其它任务时,挂机一晚上,其中这个任务也要用到 WSL2/Docker 环境(后面才晓得),CC 他搞定了:
“- WSL2 本体健康:内核 2.9.4.0,docker-desktop 发行版状态 Running/WSL2,WSLService 服务在跑。- Docker 引擎在跑:docker version 返回 Client 29.6.1 / Server Docker Desktop 4.82.0,容器
pcos-db(pgvector/pg16)已稳定运行 4 小时,端口 5896 正常映射。”
结论:CC 不是一个废物,我是个 FW,CC 说什么我就信什么,有时就是让 CC 死搞就完事。
我已用 Windows Python 环境,把你的给我的提示词”口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。“直接甩过去给 CC 用 VoxCPM 克隆出能用的语音了,谢谢。
我是技术小白,也听从建议从 CC 切换到 Hermes+DeepSeek 但前期 Hermes+DeepSeek 有些蠢,还有些抽筋,活干得没有 CC 满意。
听人听劝,有饭吃。Hermes+DeepSeek 要逐步切换过去,但目前还没有找到合适的途经和方法。
声音克隆出来了,声音后期要配背景音乐还有什么开场音乐、转场音乐、最后还有什么收尾音乐。
道道难关,关关要过!这道关,如何过?
顺带记录一下:
现在做的内容涉及到本地模型和云端模型分工的问题。
这二天在做本地模型的输出内容质量校对,从在本地模型的提示词上花费了不少时间,后面发现云端能解决输出质量的问题。对本地模型在我这个任务的能力的边界有了新的认识。
思考:可能所谓的懂技术,只不过通过时间转化为少花费 Token。 - Docker 引擎在跑:docker version 返回 Client 29.6.1 / Server Docker Desktop 4.82.0,容器
-
对于 死磕 windows ,我只好不说什么了。你的逻辑思路一直是BUG状态。只能你自己修复。