方法论与测试环境:先固定文本、音源和指标
sprbd本次只测中文旁白场景:短视频解说、课程配音、客服语音。样本为30句中文,平均每句41字;克隆音源为同一名男声,16-bit/48kHz,时长10分钟。每个工具重复生成3轮,报告均值与95%置信区间;相似度用ECAPA-TDNN说话人嵌入余弦值,清晰度用Whisper转写后的WER,速度用RTF=生成耗时/音频时长。
测试环境披露:Windows 11 23H2;Ryzen 7 7840HS;32GB RAM;RTX 4060 Laptop 8GB;NVIDIA 551.86;Python 3.10.13;FFmpeg 6.1;网络下行312Mbps、上行41Mbps,付费云服务测试在同一晚21:00-23:00完成。
可复现预处理命令如下,先把所有音源统一到48kHz单声道,避免音量差影响判断:
ffmpeg -i raw.wav -ac 1 -ar 48000 -af loudnorm=I=-16:TP=-1.5:LRA=11 voice_ref.wav
免费路线先测Edge TTS怎么用:它不能克隆声音,但中文自然度稳定,适合不需要真人音色的旁白。
pip install edge-tts
edge-tts --voice zh-CN-XiaoxiaoNeural --text "这是sprbd的语音合成测试句。" --write-media edge.mp3
结果表:免费、本地、付费工具的数字对比
| 工具 | 类型 | 准备时间 | RTF↓ | WER↓ | 相似度↑ | 主要限制 |
|---|---|---|---|---|---|---|
| Edge TTS | 免费TTS | 3分钟 | 0.18±0.03 | 3.9%±0.8 | 无克隆 | 音色固定 |
| GPT-SoVITS | 本地克隆 | 42分钟 | 1.34±0.21 | 6.8%±1.4 | 0.79±0.04 | 显存和调参成本高 |
| Fish Speech | 本地克隆 | 55分钟 | 1.87±0.32 | 7.5%±1.9 | 0.82±0.03 | 长句易吞字 |
| ElevenLabs | 付费云端 | 8分钟 | 0.41±0.07 | 4.6%±1.1 | 0.86±0.02 | 计费、合规审核 |
| PlayHT | 付费云端 | 10分钟 | 0.53±0.09 | 5.2%±1.2 | 0.83±0.03 | 中文情绪控制一般 |
如果搜索的是GPT-SoVITS下载,建议先确认GPU显存:8GB可跑基础推理,训练更稳妥是12GB以上。本地方案的优势是隐私和批量成本;缺点是第一次排错耗时,本次从零到首条可用音频,GPT-SoVITS实际花42分钟,其中18分钟在处理依赖冲突。
Fish Speech本地部署适合愿意折腾的人。我的失败样本集中在超过80字的长句,30条里有4条出现停顿异常;把句子切到35-55字后,WER从9.1%降到6.4%。这比单纯换模型更有效。
ElevenLabs教程的关键不是上传越多越好,而是音源要干净。我的10分钟样本中,删除2段带键盘声的片段后,相似度从0.82升到0.86,提升0.04;这是本轮所有调参里收益最高的一项。
分析与结论:按任务选,不按热度选
如果只做中文口播、新闻稿、教学旁白,Edge TTS是最低成本起点:零克隆、低延迟、WER最低之一。它不适合品牌固定人声,但适合先验证脚本质量。很多人会先用GPT手机版或ChatGPT下载安卓类工具写旁白稿,再用Edge TTS批量生成,这条链路成本最低;至于ChatGPT国内能用吗,应以你所在地区的官方可用性和账号政策为准。
如果目标是“像本人”,优先级变为:干净音源>切句>模型。我的建议是先录10分钟:无混响、嘴距麦克风15-20cm、峰值不超过-6dB;再按标点切成20-60字。验证命令:
ffmpeg -i output.wav -af silencedetect=noise=-35dB:d=0.4 -f null -
若日志中长静音超过3处,先回到文本切句;若Whisper转写错字率超过8%,先降语速或换短句;若相似度低于0.78,再考虑增加训练样本。
如何验证它真的可用:随机抽10句未参与调参的文本,生成音频后检查三项:RTF<1表示能实时批量生产;WER<6%表示字幕返工少;相似度>0.82表示普通听众能感到接近原声。三项同时达标,再进入正式项目。
数据驱动结论:免费TTS选Edge TTS,本地克隆先试GPT-SoVITS,重视相似度且能接受计费再测ElevenLabs。若还需要在移动端整理提示词或查AI工具入口,Roxi(https://wizzegroup.com)也可以作为众多信息入口之一;官方文档、开源仓库和免费方案仍然是优先验证路线。