<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！]]></title><description><![CDATA[<p dir="auto">求助，文字（文案、剧本）转音频（单人口播），<br />
AI 音太明显，口播过程声音还会变形，感觉一个口播稿放完似乎换了几个人，声音全程稳定性不够。<br />
显卡 RTX 3050 8G 显存</p>
<hr />
<p dir="auto">过程：一开始使用 claude code 推荐 CosyVoice 给我选择了一个川渝口音，不合适。<br />
看了视频，觉得 voxcpm 好像不错，就选了  voxcpm 一上来就开始牛逼轰轰的克隆别人声音，做出试听的 DEMO 发现一团糟（杂声，断句前加其它音等等）一看，这不行，就先把声音这事先搁置了，先搞文案了。<br />
巧的很，方案搞得差不了，看到超版的视频，voxcpm2 好像能再试一下，使用 claude code 一顿操作，感觉快看到这个路走通的希望，但一按方案做出 DEMO 好像还是回到了原点。</p>
<hr />
<p dir="auto">我不懂编程也不懂技术，全是使用 claude code 一顿想当然的输出。<br />
针对现状，应该如何解决（声音稳定、声音似人度高、声音感情调整后还能听起来像一个人）：是更换 TTS 还是调整和 AI agent 沟通提示词，还是有其它 Skill 可以借鉴，还是有其它路径，求大神指点。</p>
]]></description><link>https://lcz.me/topic/840/求助帖-文字-文案-剧本-转音频-声音-ai-化太明显</link><generator>RSS for Node</generator><lastBuildDate>Sun, 26 Jul 2026 20:02:12 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/840.rss" rel="self" type="application/rss+xml"/><pubDate>Mon, 13 Jul 2026 03:33:30 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Thu, 23 Jul 2026 12:05:24 GMT]]></title><description><![CDATA[<p dir="auto"><a href="https://upload.lcz.me/uploads/73cc2928-796f-4cb3-9e19-e451e516a0f4.py" rel="nofollow ugc">dialog.py</a><br />
<a href="https://upload.lcz.me/uploads/a239f8a3-e0f9-4a70-a420-18c73e59bd6b.md" rel="nofollow ugc">README.md</a></p>
<p dir="auto">FYI: <a href="http://README.md" rel="nofollow ugc">README.md</a> 是我安装 VoxCPM 1.5 的记录; <a href="http://dialog.py" rel="nofollow ugc">dialog.py</a> 是用来生成两人对话 mp3 的脚本. 主要是hermes+qwen2.6-27B帮忙试出来的. 用的是 16G 的 N 卡. 效果还行. 我刚开始弄的时候把事情想得太简单, 实际过程发现还是要了解一些细节才行. 一键生成---还是太理想了.</p>
]]></description><link>https://lcz.me/post/10376</link><guid isPermaLink="true">https://lcz.me/post/10376</guid><dc:creator><![CDATA[laobenxiong]]></dc:creator><pubDate>Thu, 23 Jul 2026 12:05:24 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Thu, 23 Jul 2026 11:56:07 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/q-maria" aria-label="Profile: Q-maria">@<bdi>Q-maria</bdi></a> 嗯, 我是把文本限制在500个字符.  时间长了, 语速原来越快, 噪音也增加. 不懂为啥.</p>
]]></description><link>https://lcz.me/post/10375</link><guid isPermaLink="true">https://lcz.me/post/10375</guid><dc:creator><![CDATA[laobenxiong]]></dc:creator><pubDate>Thu, 23 Jul 2026 11:56:07 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Thu, 23 Jul 2026 09:39:00 GMT]]></title><description><![CDATA[<p dir="auto">对于 死磕 windows ，我只好不说什么了。你的逻辑思路一直是BUG状态。只能你自己修复。</p>
]]></description><link>https://lcz.me/post/10368</link><guid isPermaLink="true">https://lcz.me/post/10368</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Thu, 23 Jul 2026 09:39:00 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Thu, 23 Jul 2026 07:21:51 GMT]]></title><description><![CDATA[<p dir="auto">小白成长之路，幸运的是有AI agent，效率会高很多</p>
]]></description><link>https://lcz.me/post/10356</link><guid isPermaLink="true">https://lcz.me/post/10356</guid><dc:creator><![CDATA[smilary]]></dc:creator><pubDate>Thu, 23 Jul 2026 07:21:51 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Tue, 21 Jul 2026 21:46:06 GMT]]></title><description><![CDATA[<p dir="auto">我是每段不让它超过30秒，发现25秒左右效果比较稳定。不过有感情的模特每段的声线会有所差异，这是比较难搞的。得选一个平读的模特</p>
]]></description><link>https://lcz.me/post/10246</link><guid isPermaLink="true">https://lcz.me/post/10246</guid><dc:creator><![CDATA[Q maria]]></dc:creator><pubDate>Tue, 21 Jul 2026 21:46:06 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Tue, 21 Jul 2026 05:03:03 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a><br />
没有第一时间看到您回复。<br />
我昨天在跑其它任务时，挂机一晚上，其中这个任务也要用到  WSL2/Docker 环境（后面才晓得），CC 他搞定了：<br />
“- WSL2 本体健康：内核 2.9.4.0，docker-desktop 发行版状态 Running/WSL2，WSLService 服务在跑。</p>
<ul>
<li>Docker 引擎在跑：docker version 返回 Client 29.6.1 / Server Docker Desktop 4.82.0，容器<br />
pcos-db（pgvector/pg16）已稳定运行 4 小时，端口 5896 正常映射。”<br />
结论：CC 不是一个废物，我是个 FW，CC 说什么我就信什么，有时就是让 CC 死搞就完事。</li>
</ul>
<hr />
<p dir="auto">我已用  Windows Python 环境，把你的给我的提示词”口播要注意段落长度，一次不能生成过长。另外不要使用Windows整合包，要用Linux或者WSL2，载入的时候检查接入ModelScope魔搭社区的采样器，降噪器，不接入差距很大，接入之后会在线加载模型，不想联网使用可以让AI设置缓存。“直接甩过去给 CC 用 VoxCPM 克隆出能用的语音了，谢谢。</p>
<hr />
<p dir="auto">我是技术小白，也听从建议从 CC 切换到 Hermes+DeepSeek 但前期 Hermes+DeepSeek 有些蠢，还有些抽筋，活干得没有 CC 满意。<br />
听人听劝，有饭吃。Hermes+DeepSeek 要逐步切换过去，但目前还没有找到合适的途经和方法。</p>
<hr />
<p dir="auto">声音克隆出来了，声音后期要配背景音乐还有什么开场音乐、转场音乐、最后还有什么收尾音乐。<br />
道道难关，关关要过！这道关，如何过？</p>
<hr />
<p dir="auto">顺带记录一下：<br />
现在做的内容涉及到本地模型和云端模型分工的问题。<br />
这二天在做本地模型的输出内容质量校对，从在本地模型的提示词上花费了不少时间，后面发现云端能解决输出质量的问题。对本地模型在我这个任务的能力的边界有了新的认识。<br />
思考：可能所谓的懂技术，只不过通过时间转化为少花费 Token。</p>
]]></description><link>https://lcz.me/post/10192</link><guid isPermaLink="true">https://lcz.me/post/10192</guid><dc:creator><![CDATA[Stoma Stoma]]></dc:creator><pubDate>Tue, 21 Jul 2026 05:03:03 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Thu, 16 Jul 2026 14:06:13 GMT]]></title><description><![CDATA[<p dir="auto">很久前我就说过 Linux解决方案 桌面版 mint 就可以。安装过程比 Windows 还要简单。但是使用者寥寥。<br />
实在搞不懂和 Windows 这个闭源死克的原因何在呢？（其实我是反WEN 统治派的。一看Windows就火大。）</p>
]]></description><link>https://lcz.me/post/9987</link><guid isPermaLink="true">https://lcz.me/post/9987</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Thu, 16 Jul 2026 14:06:13 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Wed, 15 Jul 2026 10:31:29 GMT]]></title><description><![CDATA[<p dir="auto">WSL2速度比windows原生快很多，我测试过，但音频生成是轻量任务，说实话，安装这个玩意其实很简单，何况你还有CC，如果这点任务都搞不定，你用CC干什么？它不是废物？实在不行建议你以后和我一样换到Hermes+DeepSeek，我的所有环境现在都是Hermes在维护，你看我的视频就知道了。就是安装VoxCPM这样的小环境是极度傻逼的日常任务，CC我想不至于这么废物吧。我今天还用它安装了新的ComfyUI环境，就很简单，我都很久没手动安装过环境了。</p>
<p dir="auto">鉴于你的情况，建议打开刘悦的技术博客，B站，下载VoxCPM，Qwen TTS的整合包，对了，最近它又发布了一个Windows下的什么语音整合包，你看他7月份发布的，效果够你用了，在Windows下点击鼠标就能跑。如果还是有问题，建议放弃本地AI，你不适合搞这个。在线的微软，谷歌，阿里的语音都挺好的，就是有敏感词审核。</p>
<p dir="auto">无论是2.0还是1.5，voxCPM还是Qwen或者其他TTS，只要量产一定会有停顿异常，需要脚本修复，就是你告诉AI，让AI写一个修复停顿异常的脚本，就这么简单。在线的也有，微软和谷歌都有，有时候还特别严重，但是大部分时候比本地要好，无需修正。这不存在指点不指点，我都明确告诉你我的生产环境，你要真想解决问题，上WSL2或者原生Linux，怎么会搞不定呢？你必须明白，克隆语音，没有任何AI能和VoxCPM相提并论，在线的也不行，这是技术路线决定的。</p>
]]></description><link>https://lcz.me/post/9938</link><guid isPermaLink="true">https://lcz.me/post/9938</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Wed, 15 Jul 2026 10:31:29 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Wed, 15 Jul 2026 05:33:37 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a><br />
前提不是帅锅<br />
我尽我的能力从昨天开始实践（”口播要注意段落长度，一次不能生成过长。另外不要使用Windows整合包，要用Linux或者WSL2，载入的时候检查接入ModelScope魔搭社区的采样器，降噪器，不接入差距很大，接入之后会在线加载模型，不想联网使用可以让AI设置缓存。“），倒腾到现在 claude code 给我下面的回复：</p>
<hr />
<p dir="auto">台式A 装 Docker/Ubuntu 这条路，被「精简版」堵死了——需要你定夺怎么走</p>
<p dir="auto">① 一句话说事<br />
你选 Docker/Ubuntu 是想绕开台式A 这套精简版 Windows。但有个隐藏的连环套：Docker Desktop 在 Windows 上并不是独立跑的，它底层骑在 WSL2 上；而 WSL2 需要「虚拟化平台」这个 Windows 组件——恰恰就是精简版被削掉、现在装不上的那个（dism 被换成了旧版 19041，启用任何系统组件都报「找不到路径」）。所以走<br />
Docker 和直接装 WSL2，卡在同一个坑里，没绕开。</p>
<p dir="auto">② 不处理会怎样 / 为什么不能换个虚拟机<br />
你可能会想「那我用 VirtualBox/VMware 装 Ubuntu 不就行了」——能装，但那类虚拟机不能把 RTX3050 的 CUDA 传进 Ubuntu，VoxCPM 是靠显卡跑的，进去也用不了 GPU。在 Windows 上能让 Linux 用上这块显卡的，只有 WSL2 一条路（它有专门的 GPU 直通），而这条路被精简版堵了。换句话说：想在这台机器上「GPU + Linux」，绕不过修 Windows。</p>
<p dir="auto">③ 三个选项</p>
<ul>
<li>A（推荐，今天就能出克隆声音）：不折腾虚拟化，直接在台式A 现成的 Windows Python 上给 VoxCPM 加降噪器 + 做克隆。刚测过——原生 CUDA 就绪（torch 2.5.1+cu121、RTX3050、voxcpm 可导入）。你要的降噪器（ModelScope ZipEnhancer）、克隆、缓存、段落长度控制全都能满足。唯一没满足的是「跑在 Linux 里」——而这条恰恰被精简版短期堵死了。0 新装、低风险、不碰系统。<br />
▎ 注：这不是你排斥的「Windows 整合包」，是你自己那套干净 venv，我只在上面把降噪器打开、加克隆逻辑。</li>
<li>B（修 Windows 再走 WSL2/Docker）：给 dism 指一个完整版 19045 安装源，把被削的服务栈补回来 → 启用虚拟化组件 → WSL2 → Docker。能满足「Linux」诉求，但精简版修复不确定，很可能要做到「就地重装」级别，有把这台日更生产机搞不稳的风险，耗时高，我不建议现在冒这个险。</li>
<li>C（并入后期换 Ubuntu）：你本来就计划台式A 升级显卡时换原生 Ubuntu。原生 Ubuntu = 完整 CUDA + 真 Linux + 没这些坑，是「Linux 跑 TTS」最干净的归宿。把这个诉求并到那次迁移，现在先用 A 出活。</li>
</ul>
<hr />
<p dir="auto">我的台式机是兼容机操作系统 Win10 19045（装机商安装），<br />
昨天开始实践时 Claud code 让我人工来操作安装我就有点不理解，试了不行，<br />
又让 Hermes 干，它也提示需要人工操作，还是不行，我又强行让他干，还是不行<br />
最后强行让  Claud code 干，就出现以上结果。<br />
可能这是个坑，这些家伙全部让我跳进去折腾，来来回回一直折腾到还未果。</p>
<hr />
<p dir="auto">目前纠结： 1、根据建议 修 Windows 再走 WSL2/Docker 风险大还影响日更生产线<br />
2、直接根据现有硬件换  Ubuntu 操作系统，风险大且未知生产线是否可以平移<br />
3、上新硬件新系统来折腾，经济和时间不划算<br />
纠结的前提是严格按要求来实践，不选择推荐的 A 方案。<br />
那么是否还有其它的路线能不换操作系统，不折腾硬件，同时也能风险小的实践。<br />
也有可能我实践的理解一开始就是错的，如果是请有空再指点！</p>
]]></description><link>https://lcz.me/post/9918</link><guid isPermaLink="true">https://lcz.me/post/9918</guid><dc:creator><![CDATA[Stoma Stoma]]></dc:creator><pubDate>Wed, 15 Jul 2026 05:33:37 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Tue, 14 Jul 2026 13:24:30 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 谢谢指导，现在立刻开始实践。</p>
<hr />
<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/williamlouis" aria-label="Profile: williamlouis">@<bdi>williamlouis</bdi></a> 谢谢喂投，我先一口一口来。</p>
]]></description><link>https://lcz.me/post/9886</link><guid isPermaLink="true">https://lcz.me/post/9886</guid><dc:creator><![CDATA[Stoma Stoma]]></dc:creator><pubDate>Tue, 14 Jul 2026 13:24:30 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Tue, 14 Jul 2026 09:24:13 GMT]]></title><description><![CDATA[<p dir="auto">audio.cpp 可以试试。别人做的加强版本<a href="https://github.com/kigner/audio.cpp-webui%E3%80%82%E5%8F%AF%E4%BB%A5%E5%85%88%E7%9C%8B%E7%9C%8B%E5%8E%9F%E7%89%88%E3%80%82%E4%BD%A0%E7%9A%84%E6%98%BE%E5%8D%A1%E6%9C%89%E7%82%B9%E4%BD%8E%E3%80%82%E5%8A%A0%E5%BC%BA%E7%89%88%E7%9A%84%E4%BD%9C%E8%80%85%E9%83%BD%E6%AF%94%E4%BD%A0%E7%9A%84%E5%8D%A1%E9%AB%98%E5%A4%AA%E5%A4%9A%E3%80%82%E5%8E%9F%E7%89%88%E4%BD%A0%E7%9B%B4%E6%8E%A5%E6%90%9C%E5%B0%B1%E5%8F%AF%E4%BB%A5%E4%BA%86%E3%80%82%E5%9C%A8" rel="nofollow ugc">https://github.com/kigner/audio.cpp-webui。可以先看看原版。你的显卡有点低。加强版的作者都比你的卡高太多。原版你直接搜就可以了。在</a> GitHub。</p>
]]></description><link>https://lcz.me/post/9877</link><guid isPermaLink="true">https://lcz.me/post/9877</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Tue, 14 Jul 2026 09:24:13 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Mon, 13 Jul 2026 20:35:40 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/stoma-stoma" aria-label="Profile: Stoma-Stoma">@<bdi>Stoma-Stoma</bdi></a> VoxCPM毫无疑问是够用的，你可以尝试1.5版本，2.0我测试了，并无明显优势，而且还慢一些。口播要注意段落长度，一次不能生成过长。另外不要使用Windows整合包，要用Linux或者WSL2，载入的时候检查接入ModelScope魔搭社区的采样器，降噪器，不接入差距很大，接入之后会在线加载模型，不想联网使用可以让AI设置缓存。</p>
<p dir="auto">你把这段话贴给你的CC看，让它照着操作。另外参考声音你去找一个你喜欢的真人主播，或者其他你听过的，觉得拟真度比较高的AI语音，不要随便选AI语音，它的克隆很精准，你给一坨屎给它模仿，就会得到一坨屎。这和你是否懂编程没关系，和你是否认真有关系。</p>
]]></description><link>https://lcz.me/post/9842</link><guid isPermaLink="true">https://lcz.me/post/9842</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Mon, 13 Jul 2026 20:35:40 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Mon, 13 Jul 2026 04:17:07 GMT]]></title><description><![CDATA[<p dir="auto">@Stoma Stoma 我理解你的困扰，折腾了一圈发现声音还是不自然，这种挫败感我很熟悉。</p>
<p dir="auto">你的情况（RTX 3050 8GB + 不懂编程）用 VoxCPM2 是对的，但有几个关键点需要注意：</p>
<ol>
<li>
<p dir="auto">声音不稳的原因是音频样本太杂<br />
VoxCPM2 克隆声音很吃输入音频质量。建议你用 5-15 秒的干净录音——单人说话、无背景音乐、无回声（用手机录一段就行）。太长或者背景杂乱的音频会导致你说的问题。</p>
</li>
<li>
<p dir="auto">GPU 8GB 跑 VoxCPM2 可行<br />
VoxCPM2 推理大概需要 4-6GB 显存，你的 3050 8GB 够了。如果跑不起来加 --vram-efficient 或 --half 参数。</p>
</li>
<li>
<p dir="auto">更简单的不折腾方案<br />
如果不想折腾本地，直接去 Azure TTS（免费的神经语音）或者 ElevenLabs，质量好而且不用考虑硬件。你已经有方案雏形了，先跑通业务逻辑再用本地 TTS 替换也来得及。</p>
</li>
<li>
<p dir="auto">文案口语化 + 分段生成<br />
稿子写得像口语（加语气词、短句），然后每 20-30 秒一段生成，比一口气生成整篇稳定得多。</p>
</li>
</ol>
<p dir="auto">先试试把克隆用的人声样本换成一个干净短录音（手机录 10 秒左右说一段话即可），用 VoxCPM2 的 --half 模式跑，声音稳定性会好很多。</p>
]]></description><link>https://lcz.me/post/9831</link><guid isPermaLink="true">https://lcz.me/post/9831</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Mon, 13 Jul 2026 04:17:07 GMT</pubDate></item><item><title><![CDATA[Reply to 求助帖，文字（文案、剧本）转音频，声音 AI 化太明显！ on Mon, 13 Jul 2026 04:04:40 GMT]]></title><description><![CDATA[<p dir="auto">TTS的话，你需要把你的文案口语化润色，并针对你的TTS方案做结构化改造。比如你的TTS是否支持语气和气口，等等。</p>
<p dir="auto">这个润色工作LLM可以做到90%，但如果想到100%，还是要手工介入。</p>
<p dir="auto">还有一点，就是你的显卡偏弱，最强的本地TTS跑不了，这也是差距之一。</p>
<p dir="auto">TTS能力可以参照这个榜单：<a href="https://artificialanalysis.ai/text-to-speech/leaderboard/selected-voice?open-weights=true" rel="nofollow ugc">https://artificialanalysis.ai/text-to-speech/leaderboard/selected-voice?open-weights=true</a></p>
]]></description><link>https://lcz.me/post/9830</link><guid isPermaLink="true">https://lcz.me/post/9830</guid><dc:creator><![CDATA[kop wang]]></dc:creator><pubDate>Mon, 13 Jul 2026 04:04:40 GMT</pubDate></item></channel></rss>