Hermes TTS(语音回复,Discord语音频道交互)本地搭建分享(4GB显存要求)
-
简而言之:Fish Speech 1.5 + 真实参考音色(可以直接让hermes去youtube和bilibili去扒,选自己喜欢的,没有bgm的,最好是那种纯聊天的视频)
关键配置:
"chunk_length": 400,
"temperature": 0.7,
"top_p": 0.8,
"repetition_penalty": 1.1,参考音色控制在15秒以内(超过20秒会过拟合,起反效果)
推理精度:FP32(~3.5GB VRAM;也可以
--halfFP16 ~1.74GB)最终性能:RTX 3070 ,0.32倍时间消耗(生成1分钟的音频,大概需要18~20秒)
推荐hermes PUA话术:
1、hermes,帮我安装fish speech1.5当作你的TTS工具
2、把(一个bilibili网址)这个视频的人的音色当作参考音色,截取最清晰的12秒
3、设置参数:如上
4、生成X个种子样例,我听听看选择哪个种子效果。
5、ok,就选x种子吧,以后回复语音的时候你要进行口语化润色。
6、把整个目前敲定的TTS流程记下来。以后我发语音给你,你就要语音回复我。 -
以上这套配置,只要hermes的基座LLM够快,完全可以支撑discord语音频道对话聊天,且没有机器人感,体验不亚于ChatGPT的Talk模式。
当然,chatGPT的语音是类似chatTTS的模拟聊天类,会有更多口语的润色效果,且支持打断。目前Fish Speech的方案还不能支持。
-
@terry 可以在不方便看文字的情况下,方便的和hermes交流。比如开车的时候,比如接入discord的语音频道群组群聊等等。
-
@terry XD,是这个意思,总之就是和锤哥的数字人配音是相反的需求。
视频配音要求高质量,不失真,人物声音设定不漂移,但性能不敏感。这个相反,性能、生成速度为第一优先级。
-
@王一民 这个分享很实用!Fish Speech 1.5 搭配 Hermes 确实能让语音交互体验提升一个档次。补充几点实战经验:
-
关于参考音色:除了去B站扒视频,Hermes 自己的 TTS 集成也很方便。如果只是想要快速测试,可以用 Hermes 内置的 Edge TTS(免费、不需要显卡),效果对日常对话场景已经够用了。
-
显存优化:如果你的 GPU 还要同时跑 LLM,Fish Speech 的 FP16 模式(~1.74GB)更友好,和 7B/8B 模型一起部署在 8GB 卡上压力不大。
-
Discord 场景:Hermes 有 Discord 集成,可以直接配置语音频道,配合 Fish Speech 就能实现你说的语音对话体验。回头看有空可以试试看效果。
-
-
@幻獸 是的,也可以接入第三方TTS服务,Hermes有三种方式接入TTS,第一是原生支持的(几个巨头的APIKEY,以及EDGE TTS,就是抖音最火的小美小帅音色,免费,快,代价就是有机器人感)
第二是他支持通过 MQTT 协议接入自定义 TTS,这个意义不大,可以不研究。
第三是通过脚本调用,推荐直接PUA Hermes让他帮你接。比如:我想把xxx的TTS API当作你的TTS工具。帮我配置一下。
-
@Devin-Hi 数字人格这个没研究过,如果从实时性上来讲,这个TTS方案本身是够的,但是可能Hermes本身不太适合承载,毕竟Hermes的工具库有点太重了,prefill的token太多,首token太慢。
从我生活中接触的来讲,应该都是自研的工程化程序,普遍有很多实时性的优化,比如第一句回复一般来讲都废话,目的就是降低回复延时,给真正的内容回复拖时间。
-
K kop wang 于 引用了 此主题
