Skip to content

语音 AI:Whisper 与 TTS

本页速览 语音 AI 的"听"与"说"——从 OpenAI Whisper 开源 ASR 到神经 TTS 与语音克隆,拆解 Transformer 音频编码、自回归与扩散式语音合成,盘点产品版图、Agent 应用,以及语音克隆诈骗与隐私风险。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

语音 AI:Whisper 与 TTS ​

语音 AI(Speech AI)是让机器"听懂人话"(语音识别 ASR)与"说出人话"(语音合成 TTS)的两类核心技术,也是人类与机器交互最自然、门槛最低的接口。2022 年 OpenAI 开源 Whisper 语音识别模型成为 ASR 领域的标杆;同期 TTS 从拼接式、神经 TTS 一路演进到 ElevenLabs、ChatTTS 等端到端方案,音色与情感表现逼近真人。如今语音 AI 是会议转写、字幕、配音、语音助手的底座,更是 AI 智能体(Agent)的"耳朵与嘴巴"。

一、背景:听与说两条主线 ​

语音 AI 大体分两大方向,对应人类听觉与发声两条通路:

方向英文做什么典型任务
语音识别Automatic Speech Recognition, ASR听:音频 → 文本转写、字幕、命令词
语音合成Text-to-Speech, TTS说:文本 → 音频配音、有声书、语音助手应答
(衍生)语音克隆Voice Cloning用少量样本复制音色个性化配音、诈骗(风险)
(衍生)说话人/语音理解Speaker Verification / Spoken Understanding辨认"谁在说、说了什么"声纹解锁、会议纪要素材

两条线共享同一批底层模型技术:2022 年之后,Transformer 架构(见 Transformer 与注意力机制)成为语音理解与生成的事实底座,语音 AI 也从"独立小模型"走向"多模态大模型的一个模态"(见 多模态模型)。

几个关键里程碑:

  • 2012–2014:深度学习取代 GMM-HMM 传统方案,DNN/HMM 混合系统让 ASR 词错误率大幅下降;
  • 2018–2020:Transformer 进入语音(LAS、Conformer),端到端 ASR 成为主流;Tacotron + WaveNet 让 TTS 告别拼接感;
  • 2022-09:OpenAI 发布 Whisper,以 68 万小时多语言弱监督语料训练,支持 99 种语言,开源即成为行业基线;
  • 2023–2025:ElevenLabs 等把"语音克隆 + 情感可控"产品化;GPT-4o 原生实时语音对话;国内豆包、通义、智谱等推出大模型语音产品;中文开源 TTS(ChatTTS、CosyVoice、Fish-Speech)密集涌现。

一句话判断:ASR 在 2022 年 Whisper 开源后被"扫平"了——通用识别不再是瓶颈,难点转移到领域专精与成本;TTS 的比拼则从"像不像人"移到"快不快、稳不稳、能不能克隆、会不会被滥用"。

二、技术底座一:ASR 的 Transformer 编码 ​

现代 ASR 的典型流程可以概括为"音频 → 特征 → 编码 → 解码对齐 → 文本":

音频波形 → 频谱特征(如 80 维 log-Mel)→ Transformer 编码器
        → 输出序列表示 → CTC / 注意力解码 / 语言模型融合 → 文本

以 Whisper 为例,它的三个关键设计:

  1. 弱监督大数据:在 68 万小时互联网音频上训练,其中 11.7 万小时覆盖 96 种语言(论文称 99 种),不依赖精细人工标注,直接预测"<|start_of_transcript|> + 语言 + 任务 + 时间戳";
  2. 编解码(Encoder-Decoder)结构:与机器翻译同构,输入是 30 秒窗口的 log-Mel 频谱,输出是带时间戳的文本 token 序列;
  3. 多任务统一:同一模型同时做转录、翻译(X→英)、时间戳、静音检测,方便产品直接复用。

Whisper 的开源权重分 tiny / base / small / medium / large 五档,large-v3 在通用测试集上词错误率(WER)已接近甚至优于此前商用水准,这让"自建转写"成本骤降。后续衍生(faster-whisper、distil-whisper)则用 CTranslate2 推理与蒸馏把速度推高数倍,见 推理优化与量化。

对开发者而言,ASR 选型的关键指标不是"谁更聪明",而是:

  • 词错误率(WER):同测试集上对比,中文要关注粤语、方言、带噪场景;
  • 延迟与吞吐:实时转写需流式(streaming)能力,离线批量则看吞吐;
  • 领域适配:会议、医疗、客服等专有词汇需在开源模型上微调(见 微调与 PEFT);
  • 成本与隐私:本地部署 vs 云端 API,敏感语音常需私有化。

语音与文本的"对齐"问题

ASR 的本质是对齐:把变长的音频帧映射到变长的文本 token。Whisper 用 attention 隐式对齐;传统方案用 CTC、HMM 显式对齐。这个对齐问题让语音模型的评测比纯文本更复杂——同一句话的"标准答案"常因口语、口音、噪音而摇摆,评测方法可参考 LLM 评估与基准。

三、技术底座二:TTS 从拼接式到端到端 ​

TTS 的演进可以概括为"拼接 → 参数/神经 → 端到端 → 大模型化"四个阶段:

阶段代表原理缺点
拼接式1990s 数据库拼接从录音库里挑片段拼接音库巨大、不自然
统计参数式HMM / 早期 DNN建模声学参数再合成有"机械味"
神经 TTSTacotron 2 + WaveNetseq2seq + 自回归声码器慢、易出错
端到端VITS、NaturalSpeech文本直接到波形稳定、快、更像人
大模型化VALL-E、ChatTTS、CosyVoice预训练 + 条件生成,可克隆算力大、滥用风险

TTS 现在的技术路径主要有两条:

  • 自回归式:像语言模型"续写 token"一样逐帧预测声学特征(VALL-E、Mega-TTS 等),自然度高但慢、可能累积错误;
  • 扩散 / Flow 式:把波形或声学特征当作生成目标,用去噪扩散或 Flow 匹配一步/少步采样(NaturalSpeech 2/3、CosyVoice 等),速度与质量均衡更优——其原理与 扩散模型与生成式 AI 同源。

现代 TTS 的另一核心是语音克隆(voice cloning):只需几秒到几分钟参考音频,即可复刻目标音色与口音。VALL-E 证明了"3 秒样本零样本克隆",ElevenLabs 把它做成了消费级产品。注意克隆能力是把双刃剑——它同时是 deepfake voice 诈骗的技术源头(见下文风险节)。

别把"像真人"当成唯一目标

TTS 产品落地更看重:稳定性(同文本多次生成不"吞字/崩音")、可控性(语速、停顿、情感标签、多说话人)、延迟(首包 <300ms 才有对话感)、合规(声音版权与克隆授权)。"像不像人"只是入场券。

四、产品版图(截至 2025 年中) ​

产品/模型厂商定位一句话点评
WhisperOpenAI开源 ASR 标杆通用识别最强开源基线,被转写产品广泛内嵌
ElevenLabsElevenLabs语音克隆 + 多语言 TTS音色/情感可控领先,API 生态成熟
GPT-4o 实时语音OpenAI端到端语音对话延迟低至亚秒级,见 ChatGPT 与对话式 AI
豆包语音 / 火山引擎字节跳动中文 ASR+TTS+克隆中文场景性价比高,覆盖数字人直播
通义语音 / 星火阿里 / 讯飞中文 ASR+TTS讯飞深耕语音多年,行业方案齐全
ChatTTS / CosyVoice / Fish-Speech开源社区中文开源 TTS免费可商用、可自托管,更新活跃

选择建议:通用转写直接上 Whisper 或大厂 API;要"产品级配音/克隆"用 ElevenLabs 类服务;中文实时对话优先试豆包/通义/讯飞;要私有化部署选开源 TTS 微调。 先用 API 验证效果,再考虑自建——这与 部署与推理优化实战 的思路一致。

五、应用场景:Agent 的耳朵与嘴巴 ​

语音 AI 的应用早已超出"语音助手":

  • 会议转写与纪要:Whisper 实时转写 + LLM 总结要点与待办,已成会议工具标配;
  • 字幕与本地化:视频字幕自动生成、多语言配音/口型适配,直接服务内容出海;
  • 有声书与数字人:TTS 朗读 + 虚拟形象,内容生产成本下降一个数量级;
  • 语音助手与车机:从"关键词唤醒"升级为多轮对话,端侧小模型 + 云端大模型混合;
  • 无障碍:视障者的屏幕朗读、失语者的语音代偿设备——语音是最有人文价值的方向之一。

更值得关注的是语音在 Agent 生态中的角色:ASR 是 Agent 的"耳朵",TTS 是 Agent 的"嘴巴"(Agent 概念见 AI 智能体(Agent))。一个完整的语音 Agent 管道是:

用户说话 → ASR(听)→ LLM / Agent 推理(想)→ TTS(说)→ 用户
                      ↑
              工具调用、RAG 检索、数据库查询

要构建这类应用,可以把"听—想—说"拆成三个独立服务并用编排层串起来(实践见 从零开发一个 Agent 与 从零搭建 RAG 应用)。语音只是入口,真正的智能仍来自背后的 大语言模型。

六、风险:语音克隆诈骗与隐私 ​

语音 AI 最尖锐的风险是深度伪造语音(deepfake voice):

  • 诈骗:2023 年起全球出现多起"冒充亲属/老板声音"的电信诈骗与商务欺诈,克隆只需几秒公开录音;
  • 证据造假:伪造语音电话、干扰声纹取证,动摇司法证据链;
  • 隐私:语音含健康、情感、身份信息,是比文本更敏感的生物特征数据;录音训练、云端处理均需告知与授权;
  • 内容合规:配音、主播克隆涉及肖像权与声音权益,商用需取得授权。

缓解思路分三层:检测(音频水印、deepfake 检测模型)、治理(平台对克隆服务做实名与授权审核、标注 AI 生成内容)、立法(多国将深度伪造与声音权益纳入监管)。这与 AI 对齐与安全治理的整体框架一致,详见 AI 安全与治理。作为开发者,至少做到:收集语音先告知授权、TTS 产品加合成标记、高风险场景引入声纹核验。

一句话红线

"克隆某人的声音"在技术上是几分钟的事,但未经授权使用涉嫌违法侵权。凡是语音产品,先过授权关,再谈体验。

延伸阅读 ​

参考资料 ​