@terry
前提不是帅锅
我尽我的能力从昨天开始实践(”口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。“),倒腾到现在 claude code 给我下面的回复:
台式A 装 Docker/Ubuntu 这条路,被「精简版」堵死了——需要你定夺怎么走
① 一句话说事
你选 Docker/Ubuntu 是想绕开台式A 这套精简版 Windows。但有个隐藏的连环套:Docker Desktop 在 Windows 上并不是独立跑的,它底层骑在 WSL2 上;而 WSL2 需要「虚拟化平台」这个 Windows 组件——恰恰就是精简版被削掉、现在装不上的那个(dism 被换成了旧版 19041,启用任何系统组件都报「找不到路径」)。所以走
Docker 和直接装 WSL2,卡在同一个坑里,没绕开。
② 不处理会怎样 / 为什么不能换个虚拟机
你可能会想「那我用 VirtualBox/VMware 装 Ubuntu 不就行了」——能装,但那类虚拟机不能把 RTX3050 的 CUDA 传进 Ubuntu,VoxCPM 是靠显卡跑的,进去也用不了 GPU。在 Windows 上能让 Linux 用上这块显卡的,只有 WSL2 一条路(它有专门的 GPU 直通),而这条路被精简版堵了。换句话说:想在这台机器上「GPU + Linux」,绕不过修 Windows。
③ 三个选项
- A(推荐,今天就能出克隆声音):不折腾虚拟化,直接在台式A 现成的 Windows Python 上给 VoxCPM 加降噪器 + 做克隆。刚测过——原生 CUDA 就绪(torch 2.5.1+cu121、RTX3050、voxcpm 可导入)。你要的降噪器(ModelScope ZipEnhancer)、克隆、缓存、段落长度控制全都能满足。唯一没满足的是「跑在 Linux 里」——而这条恰恰被精简版短期堵死了。0 新装、低风险、不碰系统。
▎ 注:这不是你排斥的「Windows 整合包」,是你自己那套干净 venv,我只在上面把降噪器打开、加克隆逻辑。
- B(修 Windows 再走 WSL2/Docker):给 dism 指一个完整版 19045 安装源,把被削的服务栈补回来 → 启用虚拟化组件 → WSL2 → Docker。能满足「Linux」诉求,但精简版修复不确定,很可能要做到「就地重装」级别,有把这台日更生产机搞不稳的风险,耗时高,我不建议现在冒这个险。
- C(并入后期换 Ubuntu):你本来就计划台式A 升级显卡时换原生 Ubuntu。原生 Ubuntu = 完整 CUDA + 真 Linux + 没这些坑,是「Linux 跑 TTS」最干净的归宿。把这个诉求并到那次迁移,现在先用 A 出活。
我的台式机是兼容机操作系统 Win10 19045(装机商安装),
昨天开始实践时 Claud code 让我人工来操作安装我就有点不理解,试了不行,
又让 Hermes 干,它也提示需要人工操作,还是不行,我又强行让他干,还是不行
最后强行让 Claud code 干,就出现以上结果。
可能这是个坑,这些家伙全部让我跳进去折腾,来来回回一直折腾到还未果。
目前纠结: 1、根据建议 修 Windows 再走 WSL2/Docker 风险大还影响日更生产线
2、直接根据现有硬件换 Ubuntu 操作系统,风险大且未知生产线是否可以平移
3、上新硬件新系统来折腾,经济和时间不划算
纠结的前提是严格按要求来实践,不选择推荐的 A 方案。
那么是否还有其它的路线能不换操作系统,不折腾硬件,同时也能风险小的实践。
也有可能我实践的理解一开始就是错的,如果是请有空再指点!