系列文章第 5 篇 · 从机械音到“以假乱真”——语音合成的进化之路


一、TTS:交互闭环的“最后一公里”

如果把语音交互比作一次完整的对话,那么 TTS(Text-to-Speech)就是系统的“嘴巴”——它负责把 AI 生成的回复文字转化为自然流畅的语音,完成整个交互闭环。

一个优秀的 TTS 系统需要同时满足三个维度:

维度 指标 目标
自然度 MOS 评分 ≥ 4.0(接近真人)
实时性 RTF(实时率) < 0.1(流式)
表现力 情感、韵律、停顿 符合对话语境

近年来,随着深度学习特别是生成模型的爆发,TTS 取得了惊人的进步——从早期机械的“电音”到如今几乎无法分辨的合成语音,甚至能克隆任何人的声音


二、TTS 技术演进路线图

1980s-2000s 波形拼接与参数合成 PSOLA / HMM-based 2005-2015 统计参数合成 HTS / DNN-based 2016-2018 神经 TTS 崛起 WaveNet / Tacotron 1/2 2019-2021 高效神经 TTS FastSpeech / HiFi-GAN / VITS 2022-2024 零样本克隆与大规模预训练 VoiceCraft / NaturalSpeech / MegaTTS 2024-2026 端到端语音大模型 GPT-4o Voice / Moshi TTS 技术演进

三、TTS 系统的标准架构

现代神经 TTS 系统通常包含三个核心模块:

声码器的职责

梅尔频谱 →
原始音频波形

声学模型的职责

音素序列 →
梅尔频谱 / 声学特征

文本前端的职责

文本正则化
123 → 一百二十三

分词 / 注音
G2P: 文字 → 音素

韵律预测
Prosody: 停顿/重音/语调

输入文本

📖 文本前端
Text Frontend

🔊 声学模型
Acoustic Model

🎵 声码器
Vocoder

输出波形

3.1 文本前端(Text Frontend)

这是 TTS 的“语文老师”——负责处理文字的发音和韵律。

文本正则化(TN):
将非标准文字转换为可读形式:

  • 数字:“2026年” → “二零二六年”

  • 符号:“$100” → “一百美元”

  • 缩写:“Dr.” → “Doctor”

字音转换(G2P, Grapheme-to-Phoneme):
将文字转换为音素序列,如“你好” → n i3 h ao3(拼音 + 声调)。

中文 G2P 的难点:

  • 多音字:“银行” (xíng) vs “人行道” (háng) vs “行道树” (xíng)

  • 变调:“你好” → 实际发音是“ní hǎo”(三声变二声 + 三声)

  • 轻声/儿化:“地方” → “dì fang”(轻声)

现代中文 TTS 正在弱化显式的 G2P——直接将汉字作为输入,让声学模型自己学习发音规则。这避免了多音字消歧的 cascaded error,但对数据量要求更高。

韵律预测(Prosody Prediction):

  • 停顿位置和时长

  • 基频(F0)走势

  • 重音位置

  • 语速变化

韵律是一句话的“灵魂”。同样一句话“我知道了”,用平淡的语调可能是确认,用升调可能是反问,用降调可能是无奈。好的 TTS 必须能在不同语境下输出不同的韵律。

3.2 声学模型(Acoustic Model)

声学模型负责从语言特征预测声学特征(最常见的目标是梅尔频谱 Mel Spectrogram)。

3.3 声码器(Vocoder)

声码器负责将声学特征“渲染”为可播放的音频波形。这是计算量最大的模块,也是决定音质的最后关口。


四、声学模型详解

4.1 Tacotron 系列:神经 TTS 的奠基者

Tacotron 1(2017) 是第一个端到端的 TTS 系统,直接从字符序列生成声学特征,省去了传统 TTS 的复杂前端流水线。

Tacotron 2(2018) 在此基础上做了关键改进:

  • 将 Attention-based Seq2Seq 与 WaveNet 声码器联合

  • 引入 Location-Sensitive Attention,解决了注意力在长句上发散的问题

  • MOS 达到 4.53,接近真人录音(4.58)

Tacotron 2 的核心结构:

字符嵌入

3层 CNN
Pre-Net

双向 LSTM 编码器

Location-Sensitive
注意力机制

上一帧梅尔频谱

2层全连接
Pre-Net

2层 LSTM 解码器

线性投影

梅尔频谱帧

Stop Token
判断是否结束

Tacotron 的局限:

  • 自回归解码,速度慢(一帧一帧地生成)

  • 注意力偶尔会出错(漏词、重复)

  • 可控性差(无法指定语速、情感等)

4.2 FastSpeech 系列:效率与可控性的突破

FastSpeech 通过**非自回归(Non-Autoregressive)**架构,一举解决了 Tacotron 的速度和鲁棒性问题。

FastSpeech 1(2019):

核心创新:

  • 长度调节器(Length Regulator) 将音素序列扩展到与梅尔频谱帧数匹配的长度

  • 基于 Transformer 的 Feed-Forward 结构,所有帧并行生成

  • 比 Tacotron 2 快 270 倍(RTF 从 ~6.7 降至 ~0.025)

FastSpeech 2(2020):

进一步改进:

  • 不再需要教师模型(FastSpeech 1 需要 Tacotron 2 提供时长标注)

  • 直接从音频中提取时长、基频(F0)、能量等韵律信息

  • 训练时学习预测这些韵律信息,推理时可显式控制音高、音量、语速

FastSpeech 2 的核心结构:

文本 → Encoder → Variance Adaptor → Decoder → 梅尔频谱
                    ├── Duration Predictor(时长预测)
                    ├── Pitch Predictor(基频预测)
                    └── Energy Predictor(能量预测)

Variance Adaptor 的作用:
这是一个巧妙的模块,它让模型能够显式控制语音的各种“变化维度”:

控制维度 效果
时长 ↑ 语速变慢
基频 ↑ 音调变高
能量 ↑ 音量变大

4.3 VITS:端到端的文本-波形 TTS

VITS(Variational Inference with adversarial learning for end-to-end Text-to-Speech)将声学模型和声码器统一为一个端到端模型,直接从文本生成波形。

核心思想:

  • 使用**变分自编码器(VAE)**框架学习文本到波形的映射

  • 引入对抗训练(GAN)提升生成质量

  • 归一化流(Normalizing Flow) 桥接先验分布和真实后验

VITS 的 MOS 已超越 Tacotron 2 + HiFi-GAN 的 cascade 方案,且推理速度更快,是 2021-2024 年间最受关注的 TTS 架构之一。


五、声码器详解

声码器负责将声学特征(梅尔频谱)“渲染”为音频波形。这是 TTS 中计算量最大、也是最影响音质的模块。

5.1 WaveNet:开辟神经声码器时代

DeepMind 的 WaveNet(2016)用自回归卷积直接对波形采样点(16kHz 采样率下每秒 16000 个点)建模:

p(x)=∏t=1Tp(xt∣x1,...,xt−1) p(x) = \prod_{t=1}^{T} p(x_t \mid x_1, ..., x_{t-1}) p(x)=t=1Tp(xtx1,...,xt1)

使用了**扩张因果卷积(Dilated Causal Convolution)**来扩大感受野,并引入门控激活:

z=tanh⁡(Wf∗x)⊙σ(Wg∗x) z = \tanh(W_f * x) \odot \sigma(W_g * x) z=tanh(Wfx)σ(Wgx)

里程碑意义:MOS 首次达到了与真人录音可媲美的水平,开启了神经 TTS 时代。

致命缺陷:推理极慢——生成 1 秒音频需要几分钟的计算,无法实时使用。

5.2 WaveGlow:基于流的快速声码器

WaveGlow(NVIDIA, 2018)用**可逆归一化流(Glow)**把简单的高斯分布变换为复杂的波形分布。特点是:单次前向传播即可生成,比 WaveNet 快得多,但模型较大。

5.3 HiFi-GAN:GAN 声码器的巅峰

HiFi-GAN(2020)将 GAN 应用于波形生成,达到了速度与音质的最佳平衡

核心结构:

  • 生成器:全卷积网络,逐层上采样梅尔频谱到高分辨率波形

  • 多周期判别器(MPD):分别关注不同周期长度的波形模式

  • 多尺度判别器(MSD):分别关注不同粒度的波形结构

  • 多尺度梅尔损失(Mel-Spectrogram Loss):辅以频域重建损失稳定训练

性能数据:

  • 在单 GPU 上 RTF ≈ 0.0005(生成 1 秒音频仅需 0.5ms)

  • MOS 与 WaveNet 持平,甚至在某些场景下更优

  • 模型小(~14M 参数),可在移动端部署

5.4 其他重要声码器

声码器 方法 特点
MelGAN GAN 比 HiFi-GAN 更早的 GAN 声码器,结构更简单
WaveRNN RNN 稀疏化 RNN,CPU 实时
LPCNet LPC + WaveRNN 用传统 LPC 做初步建模,RNN 做残差,极致轻量
BigVGAN GAN + 大模型 NVIDIA 2023 出品,SOTA 音质
Vocos GAN + 傅里叶特征 2024 年新秀,极简架构

六、前沿方向

6.1 语音克隆(Voice Cloning)

语音克隆的目标是:用极少的目标说话人样本(甚至 3 秒),合成出其任意内容的语音

技术路线:

路线 代表方法 数据需求
微调式(Fine-tuning) 在预训练多说话人 TTS 上微调 几分钟
说话人编码(Speaker Encoding) 用说话人编码器提取 embedding,注入 TTS 几秒钟
零样本(Zero-shot) 只需参考音频,无需任何训练 3-10 秒
大模型 in-context 将参考语音作为 prompt,大模型直接续写 几秒

代表工作:

  • VoiceCraft(2024):基于神经音频编解码器(EnCodec)的零样本 TTS,只需几秒参考音频即可克隆

  • NaturalSpeech 3(微软, 2024):用分解式编解码器分别建模内容、韵律、音色和声学细节

  • XTTS(Coqui):开源的多语言语音克隆方案,支持 17+ 语言

  • GPT-SoVITS:开源中文 TTS + 克隆方案,社区活跃

伦理考虑:

语音克隆技术带来的安全风险不容忽视。业界正在推进:

  • 音频水印:在合成音频中嵌入不可感知的标识

  • 说话人验证:合成前需验证说话人授权

  • 合成检测:训练鉴别器识别合成语音

6.2 情感与表现力合成

传统的 TTS 偏重“读得准”,前沿研究则追求“读得好”——让合成的语音带有恰当的情感色彩。

方法分类:

方法 说明
情感标签控制 训练时按情感类别标注,推理时指定情感标签
参考音频引导 提供带有目标情感的参考音频,模型学习其韵律风格
上下文自动推断 从文本语义和对话上下文自动推断合适的情感
细粒度韵律控制 显式控制基频、能量、时长等声学参数

6.3 流式 TTS

在语音交互中,用户不能等完系统“想好了”再一次性播放——那是对话,不是读稿子。

流式 TTS 的挑战:

  • G2P 的左右依赖:一个字的发音可能依赖后面的字(如连读变调),而流式场景下后面的字还没生成

  • 韵律的整体性:句子的语调通常需要看到整句才能确定

  • 声码器的逐帧生成:部分声码器(如 HiFi-GAN)天然支持逐帧输入,但也需要足够的上下文

主流方案:

  • Incremental TTS:LLM 逐 token 输出 → 小窗口拼接 → 逐帧合成

  • Chunk-based:LLM 输出一个语义 chunk → TTS 一次合成整个 chunk → 流式播放

  • 端到端语音大模型:GPT-4o 等模型天然流式输出音频 token


七、开源工具与上手实践

工具/框架 定位 特点
Coqui TTS 通用 TTS 工具箱 模型丰富,文档完善,社区已停止维护但代码可用
ESPnet-TTS 学术研究 TTS 复现最新论文,更新最快
Amphion 开源音频生成 上交/香港中文大学出品,支持 TTS + SVC + 音效
GPT-SoVITS 中文 TTS + 克隆 社区活跃,部署友好,效果优秀
ChatTTS 对话 TTS 2024 年现象级开源项目,专为对话场景优化
Fish Speech 多模态语音 2024 新秀,支持 TTS + 声音转换

上手建议:如果只选一个,推荐从 ChatTTSGPT-SoVITS 开始——它们是 2024 年中文社区最活跃的项目,部署门槛低,效果出色。


八、计算复杂度对比

模型 类型 参数量 RTF(GPU V100) 音质 MOS
WaveNet 声码器 ~4M ~100 4.40
WaveGlow 声码器 ~87M ~0.05 4.30
HiFi-GAN v1 声码器 ~14M ~0.0005 4.38
Tacotron 2 声学模型 ~28M ~6.7 4.53
FastSpeech 2 声学模型 ~26M ~0.025 4.47
VITS 端到端 ~27M ~0.01 4.50
ChatTTS 端到端 ~300M ~0.05 ~4.4(对话)

注:RTF 越小越好;MOS 满分为 5.0,≥ 4.0 为“自然”。数据来源于各论文报告,实际表现因测试集而异。


九、总结

TTS 在短短 8 年间完成了从机械到自然的惊人飞跃。当前的技术栈可以概括为:

层次 主流技术
文本前端 端到端字符建模(弱化 G2P)+ 韵律预测
声学模型 FastSpeech 2(非自回归,高效可控);VITS(端到端)
声码器 HiFi-GAN(GAN 路线,音质与速度最优平衡)
语音克隆 说话人编码 + Zero-shot 适配
前沿探索 端到端语音大模型中的 TTS 能力

对实践者的建议:从 ChatTTS 或 GPT-SoVITS 快速体验效果,然后用 FastSpeech 2 + HiFi-GAN 理解 TTS 的模块化架构,最后尝试 VITS 理解端到端范式。


上一篇:AI语音交互算法之自然语言理解与对话管理

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐