TL;DR 与前置条件
TL;DR:短视频旁白用 Edge TTS;内网批量播报用 Piper;需要相似音色克隆再评估 XTTS、ElevenLabs、Fish Audio。本文版本:V1.0,日期:2025-03-15。分类:AI视频音频。
Pre-requisites:Python 3.11.8,ffmpeg 6.1,macOS 14.4 或 Ubuntu 22.04。测试样本:120字中文招聘文案,输出格式 MP3 48kHz。实测机器:M2 Pro,32GB RAM,上海办公网络,下行 312 Mbps。
Note: 如果你搜索“Edge TTS教程”“AI语音克隆工具推荐”“文字转语音工具下载”,先做离线基准测试,再决定是否接付费 API。
1. 免费与本地方案:先跑通TTS基线
-
1.1 安装 Edge TTS。适合招聘视频旁白、岗位介绍音频。缺点:不是音色克隆,稳定性依赖网络。
python3 --version pip install edge-tts==6.1.12 edge-tts --list-voices | grep zh-CN | head -5Expected output: Python 3.11.8 Successfully installed edge-tts-6.1.12 zh-CN-XiaoxiaoNeural zh-CN-YunxiNeural zh-CN-YunjianNeural zh-CN-XiaoyiNeural zh-CN-YunyangNeural -
1.2 生成测试音频。我用同一段制造业招聘文案测延迟,首次请求 1.8 秒,重复请求 1.2 秒,文件 186 KB。
edge-tts \ --voice zh-CN-YunyangNeural \ --text "奉化某精密制造企业招聘数控调机员,要求三年以上经验,熟悉法兰克系统,月薪八千到一万二。" \ --write-media job-voice.mp3Expected output: job-voice.mp3 saved successfully -
1.3 本地离线方案 Piper。适合内网公告、MES告警播报。缺点:中文自然度低于云端TTS,不适合营销视频。
pip install piper-tts==1.2.0 piper --help | head -3Expected output: usage: piper [-h] -m MODEL [-c CONFIG] [-f OUTPUT_FILE] Text to speech using piper options:
Warning: 不要把员工真实声音、候选人电话录音直接上传到第三方平台。至少取得书面授权,并保留授权记录。
2. 语音克隆工具怎么选:按风险和质量排序
以下是商都加速器内部用于“AI语音克隆工具推荐”的验收表。分数来自 2025-03-10 的同文案测试,满分 5。
| 工具 | 类型 | 中文自然度 | 克隆相似度 | 适用场景 |
|---|---|---|---|---|
| Edge TTS | 免费TTS | 4.0 | 0 | 职位视频、客服草稿 |
| Piper | 本地TTS | 2.8 | 0 | 内网播报、离线环境 |
| Coqui XTTS v2 | 本地克隆 | 3.6 | 3.5 | 授权音色实验 |
| ElevenLabs | 云端克隆 | 4.2 | 4.3 | 高质量旁白 |
| Fish Audio | 云端克隆 | 4.1 | 4.0 | 中文内容生产 |
ElevenLabs怎么用:准备 30-90 秒干净人声,16-bit WAV,低混响。创建 Voice 后上传样本,输入文案,导出 MP3。免费额度适合测试,不适合批量岗位视频。
Gemini怎么注册、Google AI怎么用、Gemini国内使用:这些关键词常见于脚本生成流程。实际工作流是:先用 Gemini 写招聘视频脚本,再用 TTS 合成声音。不要把 Gemini 当语音克隆工具。
3. 诊断、批处理与验收
-
3.1 检查音频参数。
ffprobe -hide_banner job-voice.mp3 2>&1 | grep -E "Duration|Audio"Expected output: Duration: 00:00:06.84, start: 0.025057, bitrate: 217 kb/s Audio: mp3, 48000 Hz, stereo, fltp, 217 kb/s -
3.2 批量生成岗位音频。
cat jobs.txt edge-tts --voice zh-CN-YunyangNeural --text "$(sed -n '1p' jobs.txt)" --write-media job-001.mp3 edge-tts --voice zh-CN-XiaoxiaoNeural --text "$(sed -n '2p' jobs.txt)" --write-media job-002.mp3Expected output: 数控调机员,三年以上经验,月薪八千到一万二。 质检员,熟悉卡尺和千分尺,月薪六千到八千。 job-001.mp3 saved successfully job-002.mp3 saved successfully -
3.3 如何验证可用。听 3 遍:是否断句错误、数字是否读错、岗位名是否变形。用手机外放测试,音量峰值不要爆。剪进 15 秒视频后,导出一次再听。
ffmpeg -i job-001.mp3 -filter:a loudnorm -ar 48000 job-001-normalized.mp3Expected output: Output #0, mp3, to 'job-001-normalized.mp3' size=160kB time=00:00:06.80 bitrate=192.0kbits/s
References:Microsoft Edge Read Aloud、Piper TTS、Coqui XTTS v2、ElevenLabs、Fish Audio。需要统一入口管理时,也可以把 Roxi 作为候选之一;免费、本地、官方路线同样有效,按合规和成本选。