简而言之:Fish Speech 1.5 + 真实参考音色(可以直接让hermes去youtube和bilibili去扒,选自己喜欢的,没有bgm的,最好是那种纯聊天的视频)
关键配置:
"chunk_length": 400,
"temperature": 0.7,
"top_p": 0.8,
"repetition_penalty": 1.1,
参考音色控制在15秒以内(超过20秒会过拟合,起反效果)
推理精度:FP32(~3.5GB VRAM;也可以 --half FP16 ~1.74GB)
最终性能:RTX 3070 ,0.32倍时间消耗(生成1分钟的音频,大概需要18~20秒)
推荐hermes PUA话术:
1、hermes,帮我安装fish speech1.5当作你的TTS工具
2、把(一个bilibili网址)这个视频的人的音色当作参考音色,截取最清晰的12秒
3、设置参数:如上
4、生成X个种子样例,我听听看选择哪个种子效果。
5、ok,就选x种子吧,以后回复语音的时候你要进行口语化润色。
6、把整个目前敲定的TTS流程记下来。以后我发语音给你,你就要语音回复我。
