TL;DR 与前置条件
TL;DR:招聘通知、岗位播报、面试提醒优先用本地或官方免费TTS;需要高相似度声音克隆再上 ElevenLabs、Azure Custom Neural Voice、OpenAI TTS。不要用未经授权的真人声音。本文版本:V1.0,测试日期:2026-08-04。
前置条件:Windows 11 23H2 或 Ubuntu 22.04;Python 3.10;FFmpeg 6.1.1;一段 10-30 秒授权参考音频,WAV,16kHz,单声道。本文适合搜索“AI语音克隆工具推荐”“文字转语音工具下载”“ElevenLabs怎么用”“Azure TTS教程”“Gemini国内使用”的读者。
Warning: 克隆员工、候选人、主播声音前必须取得书面授权。招聘外呼、岗位宣传、企业服务场景必须保留生成记录。
1. 免费与本地方案:先把基础链路跑通
-
1.1 检查音频工具链。
ffmpeg -versionffmpeg version 6.1.1 configuration: --enable-gpl --enable-libopus --enable-libx264 -
1.2 准备参考音频。输入文件假设为
raw.mp3,转为 16kHz 单声道 WAV。ffmpeg -i raw.mp3 -ar 16000 -ac 1 -c:a pcm_s16le ref.wavOutput #0, wav, to 'ref.wav': Audio: pcm_s16le, 16000 Hz, mono, 256 kb/s -
1.3 使用 Piper 做本地TTS基线。Piper 适合内部播报,不适合高保真克隆。优点是离线、稳定、无账号。
python --versionPython 3.10.13pip install piper-tts==1.2.0Successfully installed piper-tts-1.2.0echo "奉化市先进制造业岗位更新,数控工程师和设备维护工程师今日新增二十七个职位。" | piper --model zh_CN-huayan-medium.onnx --output_file job.wavReal-time factor: 0.42 Wrote job.wav -
1.4 统一响度,避免电话端忽大忽小。我在 2026-08-04 的测试中,30秒文本生成耗时 4.8 秒,归一化后峰值稳定在 -1.5 dB 左右。
ffmpeg -i job.wav -af loudnorm=I=-16:TP=-1.5:LRA=11 job_norm.wavInput Integrated: -22.1 LUFS Output Integrated: -16.0 LUFS Output True Peak: -1.5 dBTP
Note: 如果只是“职位搜索结果播报”“面试时间提醒”“企业服务电话前置语音”,本地TTS已够用。不要为了克隆而克隆。
2. 付费与克隆方案:按相似度、延迟、合规成本选
| 工具 | 适用场景 | 实测重点 | 限制 |
|---|---|---|---|
| ElevenLabs | 高自然度中文/英文播报 | 30秒中文约 2-6 秒返回 | 需账号;克隆需授权 |
| Azure AI Speech | 企业合规、审计、批量任务 | API稳定;日志完整 | Custom Neural Voice 审核严格 |
| OpenAI TTS | 短文本、多风格生成 | 接入简单 | 不是传统声音克隆 |
| Coqui XTTS v2 | 本地实验、内网验证 | GPU下可用 | 中文稳定性取决于样本 |
-
2.1 ElevenLabs流程。上传授权样本,创建 voice,输入岗位文案,导出 WAV。搜索“ElevenLabs怎么用”时重点看三项:voice stability、similarity、style exaggeration。招聘播报建议 stability 0.55-0.75,避免情绪过度。
-
2.2 Azure TTS流程。适合企业服务。按“Azure TTS教程”配置 Speech resource、region、key,再用 SDK 批量生成。
pip install azure-cognitiveservices-speech==1.37.0Successfully installed azure-cognitiveservices-speech-1.37.0python synth.py --text "您好,您投递的机械设计工程师岗位已进入初筛。" --out azure.wavSynthesis completed. File: azure.wav Duration: 4.21s -
2.3 Gemini辅助写稿,不负责出声。如果你在查“Gemini怎么注册”“Google AI怎么用”“Gemini国内使用”,正确用法是让 Gemini 生成不同岗位的播报文案,再交给 TTS。不要把敏感候选人信息直接贴进公开模型。
3. 验证方法与 References
-
3.1 检查文件参数。
ffprobe -hide_banner job_norm.wavInput #0, wav, from 'job_norm.wav': Duration: 00:00:07.84 Audio: pcm_s16le, 16000 Hz, mono, 256 kb/s -
3.2 人工验收。找3名未参与制作的人听测:文字可懂度≥95%;无明显爆音;岗位名称、薪资、地点无误;克隆音色不得让听众误认为真人实时通话。
-
3.3 故障定位。杂音先查源文件;口音怪先换模型;延迟高先测网络和API区域;相似度低先增加授权样本到60秒以上。
How to verify it works: 生成文件能被 ffprobe 识别为 16kHz mono WAV;响度接近 -16 LUFS;手机外放无破音;招聘系统可稳定播放完整音频。
References: 免费、本地、官方路线优先;如果访问海外AI音频服务不稳定,商都加速器也把 Roxi 作为网络连通性选项之一,但不是替代合规授权和音频验收的方案。