外观
语音 AI:Whisper 与 TTS
语音 AI(Speech AI)是让机器"听懂人话"(语音识别 ASR)与"说出人话"(语音合成 TTS)的两类核心技术,也是人类与机器交互最自然、门槛最低的接口。2022 年 OpenAI 开源 Whisper 语音识别模型成为 ASR 领域的标杆;同期 TTS 从拼接式、神经 TTS 一路演进到 ElevenLabs、ChatTTS 等端到端方案,音色与情感表现逼近真人。如今语音 AI 是会议转写、字幕、配音、语音助手的底座,更是 AI 智能体(Agent)的"耳朵与嘴巴"。
一、背景:听与说两条主线
语音 AI 大体分两大方向,对应人类听觉与发声两条通路:
| 方向 | 英文 | 做什么 | 典型任务 |
|---|---|---|---|
| 语音识别 | Automatic Speech Recognition, ASR | 听:音频 → 文本 | 转写、字幕、命令词 |
| 语音合成 | Text-to-Speech, TTS | 说:文本 → 音频 | 配音、有声书、语音助手应答 |
| (衍生)语音克隆 | Voice Cloning | 用少量样本复制音色 | 个性化配音、诈骗(风险) |
| (衍生)说话人/语音理解 | Speaker Verification / Spoken Understanding | 辨认"谁在说、说了什么" | 声纹解锁、会议纪要素材 |
两条线共享同一批底层模型技术:2022 年之后,Transformer 架构(见 Transformer 与注意力机制)成为语音理解与生成的事实底座,语音 AI 也从"独立小模型"走向"多模态大模型的一个模态"(见 多模态模型)。
几个关键里程碑:
- 2012–2014:深度学习取代 GMM-HMM 传统方案,DNN/HMM 混合系统让 ASR 词错误率大幅下降;
- 2018–2020:Transformer 进入语音(LAS、Conformer),端到端 ASR 成为主流;Tacotron + WaveNet 让 TTS 告别拼接感;
- 2022-09:OpenAI 发布 Whisper,以 68 万小时多语言弱监督语料训练,支持 99 种语言,开源即成为行业基线;
- 2023–2025:ElevenLabs 等把"语音克隆 + 情感可控"产品化;GPT-4o 原生实时语音对话;国内豆包、通义、智谱等推出大模型语音产品;中文开源 TTS(ChatTTS、CosyVoice、Fish-Speech)密集涌现。
一句话判断:ASR 在 2022 年 Whisper 开源后被"扫平"了——通用识别不再是瓶颈,难点转移到领域专精与成本;TTS 的比拼则从"像不像人"移到"快不快、稳不稳、能不能克隆、会不会被滥用"。
二、技术底座一:ASR 的 Transformer 编码
现代 ASR 的典型流程可以概括为"音频 → 特征 → 编码 → 解码对齐 → 文本":
音频波形 → 频谱特征(如 80 维 log-Mel)→ Transformer 编码器
→ 输出序列表示 → CTC / 注意力解码 / 语言模型融合 → 文本以 Whisper 为例,它的三个关键设计:
- 弱监督大数据:在 68 万小时互联网音频上训练,其中 11.7 万小时覆盖 96 种语言(论文称 99 种),不依赖精细人工标注,直接预测"<|start_of_transcript|> + 语言 + 任务 + 时间戳";
- 编解码(Encoder-Decoder)结构:与机器翻译同构,输入是 30 秒窗口的 log-Mel 频谱,输出是带时间戳的文本 token 序列;
- 多任务统一:同一模型同时做转录、翻译(X→英)、时间戳、静音检测,方便产品直接复用。
Whisper 的开源权重分 tiny / base / small / medium / large 五档,large-v3 在通用测试集上词错误率(WER)已接近甚至优于此前商用水准,这让"自建转写"成本骤降。后续衍生(faster-whisper、distil-whisper)则用 CTranslate2 推理与蒸馏把速度推高数倍,见 推理优化与量化。
对开发者而言,ASR 选型的关键指标不是"谁更聪明",而是:
- 词错误率(WER):同测试集上对比,中文要关注粤语、方言、带噪场景;
- 延迟与吞吐:实时转写需流式(streaming)能力,离线批量则看吞吐;
- 领域适配:会议、医疗、客服等专有词汇需在开源模型上微调(见 微调与 PEFT);
- 成本与隐私:本地部署 vs 云端 API,敏感语音常需私有化。
语音与文本的"对齐"问题
ASR 的本质是对齐:把变长的音频帧映射到变长的文本 token。Whisper 用 attention 隐式对齐;传统方案用 CTC、HMM 显式对齐。这个对齐问题让语音模型的评测比纯文本更复杂——同一句话的"标准答案"常因口语、口音、噪音而摇摆,评测方法可参考 LLM 评估与基准。
三、技术底座二:TTS 从拼接式到端到端
TTS 的演进可以概括为"拼接 → 参数/神经 → 端到端 → 大模型化"四个阶段:
| 阶段 | 代表 | 原理 | 缺点 |
|---|---|---|---|
| 拼接式 | 1990s 数据库拼接 | 从录音库里挑片段拼接 | 音库巨大、不自然 |
| 统计参数式 | HMM / 早期 DNN | 建模声学参数再合成 | 有"机械味" |
| 神经 TTS | Tacotron 2 + WaveNet | seq2seq + 自回归声码器 | 慢、易出错 |
| 端到端 | VITS、NaturalSpeech | 文本直接到波形 | 稳定、快、更像人 |
| 大模型化 | VALL-E、ChatTTS、CosyVoice | 预训练 + 条件生成,可克隆 | 算力大、滥用风险 |
TTS 现在的技术路径主要有两条:
- 自回归式:像语言模型"续写 token"一样逐帧预测声学特征(VALL-E、Mega-TTS 等),自然度高但慢、可能累积错误;
- 扩散 / Flow 式:把波形或声学特征当作生成目标,用去噪扩散或 Flow 匹配一步/少步采样(NaturalSpeech 2/3、CosyVoice 等),速度与质量均衡更优——其原理与 扩散模型与生成式 AI 同源。
现代 TTS 的另一核心是语音克隆(voice cloning):只需几秒到几分钟参考音频,即可复刻目标音色与口音。VALL-E 证明了"3 秒样本零样本克隆",ElevenLabs 把它做成了消费级产品。注意克隆能力是把双刃剑——它同时是 deepfake voice 诈骗的技术源头(见下文风险节)。
别把"像真人"当成唯一目标
TTS 产品落地更看重:稳定性(同文本多次生成不"吞字/崩音")、可控性(语速、停顿、情感标签、多说话人)、延迟(首包 <300ms 才有对话感)、合规(声音版权与克隆授权)。"像不像人"只是入场券。
四、产品版图(截至 2025 年中)
| 产品/模型 | 厂商 | 定位 | 一句话点评 |
|---|---|---|---|
| Whisper | OpenAI | 开源 ASR 标杆 | 通用识别最强开源基线,被转写产品广泛内嵌 |
| ElevenLabs | ElevenLabs | 语音克隆 + 多语言 TTS | 音色/情感可控领先,API 生态成熟 |
| GPT-4o 实时语音 | OpenAI | 端到端语音对话 | 延迟低至亚秒级,见 ChatGPT 与对话式 AI |
| 豆包语音 / 火山引擎 | 字节跳动 | 中文 ASR+TTS+克隆 | 中文场景性价比高,覆盖数字人直播 |
| 通义语音 / 星火 | 阿里 / 讯飞 | 中文 ASR+TTS | 讯飞深耕语音多年,行业方案齐全 |
| ChatTTS / CosyVoice / Fish-Speech | 开源社区 | 中文开源 TTS | 免费可商用、可自托管,更新活跃 |
选择建议:通用转写直接上 Whisper 或大厂 API;要"产品级配音/克隆"用 ElevenLabs 类服务;中文实时对话优先试豆包/通义/讯飞;要私有化部署选开源 TTS 微调。 先用 API 验证效果,再考虑自建——这与 部署与推理优化实战 的思路一致。
五、应用场景:Agent 的耳朵与嘴巴
语音 AI 的应用早已超出"语音助手":
- 会议转写与纪要:Whisper 实时转写 + LLM 总结要点与待办,已成会议工具标配;
- 字幕与本地化:视频字幕自动生成、多语言配音/口型适配,直接服务内容出海;
- 有声书与数字人:TTS 朗读 + 虚拟形象,内容生产成本下降一个数量级;
- 语音助手与车机:从"关键词唤醒"升级为多轮对话,端侧小模型 + 云端大模型混合;
- 无障碍:视障者的屏幕朗读、失语者的语音代偿设备——语音是最有人文价值的方向之一。
更值得关注的是语音在 Agent 生态中的角色:ASR 是 Agent 的"耳朵",TTS 是 Agent 的"嘴巴"(Agent 概念见 AI 智能体(Agent))。一个完整的语音 Agent 管道是:
用户说话 → ASR(听)→ LLM / Agent 推理(想)→ TTS(说)→ 用户
↑
工具调用、RAG 检索、数据库查询要构建这类应用,可以把"听—想—说"拆成三个独立服务并用编排层串起来(实践见 从零开发一个 Agent 与 从零搭建 RAG 应用)。语音只是入口,真正的智能仍来自背后的 大语言模型。
六、风险:语音克隆诈骗与隐私
语音 AI 最尖锐的风险是深度伪造语音(deepfake voice):
- 诈骗:2023 年起全球出现多起"冒充亲属/老板声音"的电信诈骗与商务欺诈,克隆只需几秒公开录音;
- 证据造假:伪造语音电话、干扰声纹取证,动摇司法证据链;
- 隐私:语音含健康、情感、身份信息,是比文本更敏感的生物特征数据;录音训练、云端处理均需告知与授权;
- 内容合规:配音、主播克隆涉及肖像权与声音权益,商用需取得授权。
缓解思路分三层:检测(音频水印、deepfake 检测模型)、治理(平台对克隆服务做实名与授权审核、标注 AI 生成内容)、立法(多国将深度伪造与声音权益纳入监管)。这与 AI 对齐与安全治理的整体框架一致,详见 AI 安全与治理。作为开发者,至少做到:收集语音先告知授权、TTS 产品加合成标记、高风险场景引入声纹核验。
一句话红线
"克隆某人的声音"在技术上是几分钟的事,但未经授权使用涉嫌违法侵权。凡是语音产品,先过授权关,再谈体验。
延伸阅读
- Transformer 与注意力机制——语音识别与合成的架构底座
- 多模态模型——语音作为大模型的音频模态
- 扩散模型与生成式 AI——扩散式 TTS 的原理来源
- ChatGPT 与对话式 AI——GPT-4o 实时语音对话案例
- AI 智能体(Agent)——语音是 Agent 的耳朵与嘴巴
- AI 安全与治理——deepfake 语音与隐私治理
- 从零开发一个 Agent——搭建"听—想—说"语音管道
- 模型与榜单速查——ASR/TTS 模型与开源资源索引
参考资料
- Radford et al. Robust Speech Recognition via Large-Scale Weak Supervision(Whisper, arXiv:2212.04356)——Whisper 原始论文
- Wang et al. Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers(VALL-E, 2023)——零样本语音克隆开创性工作
- Shen et al. NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers(2023)——扩散式 TTS 代表
- van den Oord et al. WaveNet: A Generative Model for Raw Audio(2016)——神经声码器鼻祖
- Shen et al. Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions(Tacotron 2, 2018)——经典神经 TTS
- ElevenLabs 官网——语音克隆与多语言 TTS 产品
- ChatTTS(开源中文 TTS)——面向对话场景的中文开源 TTS
- OpenAI 关于 Whisper 的官方介绍