一、语音识别(ASR)

语音识别的目标是:把人类说话的声音转换成对应的文字

1. 基本流程

  1. 声音采集:通过麦克风采集语音信号。

  2. 特征提取:把原始语音信号转化为更便于机器处理的特征(如 MFCC、梅尔频谱、声学特征向量)。

  3. 声学建模:建模语音信号和音素的对应关系。

    • 传统方法:隐马尔可夫模型 (HMM) + 高斯混合模型 (GMM)。

    • 现代方法:深度神经网络(DNN、CNN、RNN、Transformer)。

  4. 语言建模:结合上下文约束,判断最合理的单词或句子。

    • 如“今天天气很好” vs “今天田七很好”。

  5. 解码输出:结合声学模型和语言模型,输出最可能的文字序列。

2. 应用

  • 智能助手(Siri、小爱同学、ChatGPT 语音输入)

  • 实时字幕/会议转写

  • 语音搜索

  • 语音控制(车载系统、智能家居)

3. 发展趋势

  • 基于 HMM-DNN 的混合模型端到端模型(End-to-End ASR)

    • CTC (Connectionist Temporal Classification)-----非自回归模型

    • RNN-T (Recurrent Neural Network Transducer)-----介于 CTC(非自回归)和 Seq2Seq(自回归)之间

    • Attention-based Transformer(如 Whisper, Conformer)-----自回归模型

  • 多语言、低资源语言的识别能力提升

  • 更强的鲁棒性(抗噪声、口音、自适应能力)

二、语音合成(TTS)

语音合成的目标是:把文字转化成自然流畅的语音

1. 基本流程

  1. 文本分析 (Text Analysis)

    • 分词、词性标注、断句、音韵标注。

    • 确定语调、重音、节奏。

  2. 声学建模 (Acoustic Modeling)

    • 把语言学特征(音素、韵律)转化为声学特征(梅尔频谱、声码器输入)。

  3. 声码器 (Vocoder)

    • 把声学特征转化为波形(最终能播放的声音)。

2. 技术流派

  • 传统方法

    • 拼接式合成(Concatenative TTS):拼接录制的语音片段。音质好但灵活性差。

    • 参数合成(Parametric TTS):用统计模型(如 HMM)生成语音,灵活但不自然。

  • 深度学习方法

    • 端到端 TTS:输入文字 → 输出语音。

    • 代表模型:

      • Tacotron / Tacotron 2

      • FastSpeech / FastSpeech 2

      • VITS(目前很流行,端到端 + 神经声码器)

    • 神经声码器:WaveNet、WaveGlow、HiFi-GAN、WaveRNN。

3. 应用

  • 虚拟助手(导航播报、读新闻、读书)

  • 无障碍服务(为视障人士朗读文字)

  • 游戏/动画/虚拟主播配音

  • 多语种翻译语音合成

4. 发展趋势

  • 更加 自然、接近人类声音,带有情感、语气。

  • 支持 零样本语音合成(Zero-shot TTS):给一小段音频,就能模仿说话人的声音。

  • 多模态融合(结合文本、语音、视频,做虚拟人或多模态对话)。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐