事实是显卡真在涨
Stoma Stoma
-
最近在在做购买硬件的打算,突然想到! -
最近在在做购买硬件的打算,突然想到!最近在在做购买硬件的打算,想到要装 ubuntu 要装这个那个环境还要这个那个配置,这个完全是我从来没有干过事,突然想到!
如果版主和论坛的大神,你们的 Hermes agent 的记忆如果共享出来,会是一个什么有意思的现象。 -
求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!@terry
没有第一时间看到您回复。
我昨天在跑其它任务时,挂机一晚上,其中这个任务也要用到 WSL2/Docker 环境(后面才晓得),CC 他搞定了:
“- WSL2 本体健康:内核 2.9.4.0,docker-desktop 发行版状态 Running/WSL2,WSLService 服务在跑。- Docker 引擎在跑:docker version 返回 Client 29.6.1 / Server Docker Desktop 4.82.0,容器
pcos-db(pgvector/pg16)已稳定运行 4 小时,端口 5896 正常映射。”
结论:CC 不是一个废物,我是个 FW,CC 说什么我就信什么,有时就是让 CC 死搞就完事。
我已用 Windows Python 环境,把你的给我的提示词”口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。“直接甩过去给 CC 用 VoxCPM 克隆出能用的语音了,谢谢。
我是技术小白,也听从建议从 CC 切换到 Hermes+DeepSeek 但前期 Hermes+DeepSeek 有些蠢,还有些抽筋,活干得没有 CC 满意。
听人听劝,有饭吃。Hermes+DeepSeek 要逐步切换过去,但目前还没有找到合适的途经和方法。
声音克隆出来了,声音后期要配背景音乐还有什么开场音乐、转场音乐、最后还有什么收尾音乐。
道道难关,关关要过!这道关,如何过?
顺带记录一下:
现在做的内容涉及到本地模型和云端模型分工的问题。
这二天在做本地模型的输出内容质量校对,从在本地模型的提示词上花费了不少时间,后面发现云端能解决输出质量的问题。对本地模型在我这个任务的能力的边界有了新的认识。
思考:可能所谓的懂技术,只不过通过时间转化为少花费 Token。 - Docker 引擎在跑:docker version 返回 Client 29.6.1 / Server Docker Desktop 4.82.0,容器
-
求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!@terry
前提不是帅锅
我尽我的能力从昨天开始实践(”口播要注意段落长度,一次不能生成过长。另外不要使用Windows整合包,要用Linux或者WSL2,载入的时候检查接入ModelScope魔搭社区的采样器,降噪器,不接入差距很大,接入之后会在线加载模型,不想联网使用可以让AI设置缓存。“),倒腾到现在 claude code 给我下面的回复:
台式A 装 Docker/Ubuntu 这条路,被「精简版」堵死了——需要你定夺怎么走
① 一句话说事
你选 Docker/Ubuntu 是想绕开台式A 这套精简版 Windows。但有个隐藏的连环套:Docker Desktop 在 Windows 上并不是独立跑的,它底层骑在 WSL2 上;而 WSL2 需要「虚拟化平台」这个 Windows 组件——恰恰就是精简版被削掉、现在装不上的那个(dism 被换成了旧版 19041,启用任何系统组件都报「找不到路径」)。所以走
Docker 和直接装 WSL2,卡在同一个坑里,没绕开。② 不处理会怎样 / 为什么不能换个虚拟机
你可能会想「那我用 VirtualBox/VMware 装 Ubuntu 不就行了」——能装,但那类虚拟机不能把 RTX3050 的 CUDA 传进 Ubuntu,VoxCPM 是靠显卡跑的,进去也用不了 GPU。在 Windows 上能让 Linux 用上这块显卡的,只有 WSL2 一条路(它有专门的 GPU 直通),而这条路被精简版堵了。换句话说:想在这台机器上「GPU + Linux」,绕不过修 Windows。③ 三个选项
- A(推荐,今天就能出克隆声音):不折腾虚拟化,直接在台式A 现成的 Windows Python 上给 VoxCPM 加降噪器 + 做克隆。刚测过——原生 CUDA 就绪(torch 2.5.1+cu121、RTX3050、voxcpm 可导入)。你要的降噪器(ModelScope ZipEnhancer)、克隆、缓存、段落长度控制全都能满足。唯一没满足的是「跑在 Linux 里」——而这条恰恰被精简版短期堵死了。0 新装、低风险、不碰系统。
▎ 注:这不是你排斥的「Windows 整合包」,是你自己那套干净 venv,我只在上面把降噪器打开、加克隆逻辑。 - B(修 Windows 再走 WSL2/Docker):给 dism 指一个完整版 19045 安装源,把被削的服务栈补回来 → 启用虚拟化组件 → WSL2 → Docker。能满足「Linux」诉求,但精简版修复不确定,很可能要做到「就地重装」级别,有把这台日更生产机搞不稳的风险,耗时高,我不建议现在冒这个险。
- C(并入后期换 Ubuntu):你本来就计划台式A 升级显卡时换原生 Ubuntu。原生 Ubuntu = 完整 CUDA + 真 Linux + 没这些坑,是「Linux 跑 TTS」最干净的归宿。把这个诉求并到那次迁移,现在先用 A 出活。
我的台式机是兼容机操作系统 Win10 19045(装机商安装),
昨天开始实践时 Claud code 让我人工来操作安装我就有点不理解,试了不行,
又让 Hermes 干,它也提示需要人工操作,还是不行,我又强行让他干,还是不行
最后强行让 Claud code 干,就出现以上结果。
可能这是个坑,这些家伙全部让我跳进去折腾,来来回回一直折腾到还未果。
目前纠结: 1、根据建议 修 Windows 再走 WSL2/Docker 风险大还影响日更生产线
2、直接根据现有硬件换 Ubuntu 操作系统,风险大且未知生产线是否可以平移
3、上新硬件新系统来折腾,经济和时间不划算
纠结的前提是严格按要求来实践,不选择推荐的 A 方案。
那么是否还有其它的路线能不换操作系统,不折腾硬件,同时也能风险小的实践。
也有可能我实践的理解一开始就是错的,如果是请有空再指点! - A(推荐,今天就能出克隆声音):不折腾虚拟化,直接在台式A 现成的 Windows Python 上给 VoxCPM 加降噪器 + 做克隆。刚测过——原生 CUDA 就绪(torch 2.5.1+cu121、RTX3050、voxcpm 可导入)。你要的降噪器(ModelScope ZipEnhancer)、克隆、缓存、段落长度控制全都能满足。唯一没满足的是「跑在 Linux 里」——而这条恰恰被精简版短期堵死了。0 新装、低风险、不碰系统。
-
求助帖,文字(文案、剧本)转音频,声音 AI 化太明显! -
论坛更新到Node BB 4.14.4@williamlouis 在技术专业上妥妥是老弟。
过去经历主要和真实世界打交道。
-
论坛更新到Node BB 4.14.4 -
求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!求助,文字(文案、剧本)转音频(单人口播),
AI 音太明显,口播过程声音还会变形,感觉一个口播稿放完似乎换了几个人,声音全程稳定性不够。
显卡 RTX 3050 8G 显存
过程:一开始使用 claude code 推荐 CosyVoice 给我选择了一个川渝口音,不合适。
看了视频,觉得 voxcpm 好像不错,就选了 voxcpm 一上来就开始牛逼轰轰的克隆别人声音,做出试听的 DEMO 发现一团糟(杂声,断句前加其它音等等)一看,这不行,就先把声音这事先搁置了,先搞文案了。
巧的很,方案搞得差不了,看到超版的视频,voxcpm2 好像能再试一下,使用 claude code 一顿操作,感觉快看到这个路走通的希望,但一按方案做出 DEMO 好像还是回到了原点。
我不懂编程也不懂技术,全是使用 claude code 一顿想当然的输出。
针对现状,应该如何解决(声音稳定、声音似人度高、声音感情调整后还能听起来像一个人):是更换 TTS 还是调整和 AI agent 沟通提示词,还是有其它 Skill 可以借鉴,还是有其它路径,求大神指点。 -
论坛更新到Node BB 4.14.4你现在做的事,可能是我有可能要做的事。
就是没事找事做,目前不具备能力硬要做。
全是 AI 预测能力给的底气,试错的时间成本和物质成本低。 -
新手村误入沃玛寺庙。@williamlouis 谢谢指点!
-
新手村误入沃玛寺庙。@kop-wang 谢谢大神回复。
““如何 Hermes 快速了解和接手 claude code 现在做的项目”
直接告诉Hermes你的项目的文件夹位置就好,Claude Code你在使用的所有痕迹都会存在你选定目录的根目录的.claude文件夹中。”这个问了一下 gemini 感觉 Hermes 还是差点意思。
为什么要换成 Hermes,原因很简单,Claude Code 订阅的 Token 不够,想换成 Hermes 加 Deepseek 省钱同时能用 Telegram 来使用。
““把它安装在 VPS 上,但数据来回传输会经常不通”
这个可以让Hermes或者Claude Code来排查,代价就是你要把你的VPS的用户名和密码提供给LLM,不过从你是新手的角度来考虑,这也没什么问题。”claude code,一开始推荐就使用 SSH 私钥的方式登录。
网络不通的事,目前是 Hermes 接手 claude code 任务碰到的问题,claude code 能解决,Hermes + Deepseek 感觉笨笨的多次不能完成。
目前能想到就是 claude code 回答怎么解决这个问题,再把答案喂给 Hermes。从我目前的使用场景还有一个解决方案使用 openrouter 来解决。
“目前硬件资源”
如果只搞用Agent进行Coding或者工作流,本质上对于硬件没什么要求。所以不急。不急,不急,一步一步来,谢谢!
-
新手村误入沃玛寺庙。本来在新手村,砍砍小鸡还挺欢快,
误入沃玛寺庙,萌生想打沃玛号角。
寻求论坛大神,教教正确升级路线,
帮你回城背药,新手村挖鸡送金币。
之前误打识撞,瞎乱操作自建机场,
现状图纸全忘,还想复制瞎操理想。
目前在做的事,把外网的文本信源采集加工后国内分发,采集和加工就事还没搞得明明白白。
在上个技能没搞明白,还硬上了文本转音频的处理,搞得 Agent 工具直接给我爆工程师黑话。
理解想丰满,认为 AI 这个预测工具,能帮我搞定一切,目前来看,一切才刚刚开始。目前在做的事,从7月3号全程在用 claude code 这个工具,使用得是低的订阅。Telegram 前二天才注册上,在 VPS 上安装 Hermes 用得 Deepseek 但对 Hermes 这个工具能快速了解和衔接我现在做的事。
目前自认为的新手升级路线图:
英文文本信源采集、文本信源翻译、翻译加工技巧(七窍通了六窍)
文本转音频处理、音频处理的烂透了(卡在这里)
我也不知道我说得有没有人能看懂,新手村的我也不会说一些工程师黑话。
寻求大神解惑:1.新手升级路线图,有什么问题,有哪些坑点和技巧给予指点一下。
2.如何 Hermes 快速了解和接手 claude code 现在做的项目(问这个问题可能会被挨骂,我用其它 AI 对话尝试做了解)
3.工作数据链通的问题,我为了能让 Hermes 能 24 在线服务,把它安装在 VPS 上,但数据来回传输会经常不通
4.目前硬件资源(WINDOWS笔记本、WINDOWS台式机 RTX 3050 8G、VPS1 Hermse、VPS2 机场),VPS2 机场图纸丢失基本只做机场。等能出新手村,立马去比奇城买装备。

