ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction

  • 2025.11

abstract

  • 之前的s2s 模型,只是根据语义理解进行内容回复,但实际上内容的传达除了文字,还有说话人的语气,语气不同,对应的语义可能千差万别。
  • 建立一个评测的benchmark,利用预训练的AudioReasoner作为打分模型
  • 训练一个可以情感一致回复的ParaS2S align(将AudioReasoner蒸馏一个快速的打分模型)

benchmark

建立副语言感知的S2S评测基准:

  • 测试文本样例构建:用ChatGPT生成大量包含“一句话内容 + 两种对立风格”的候选,文本内容中性,模型无法仅凭文字猜出说话者的状态,配上两种对比鲜明的说话风格(如真诚 vs. 讽刺),并且对应的回答不能相同
  • 语音合成:gpt-4o-mini-tts 对筛选后的文本进行合成,并进行人工检查
  • 基于音频进行评估:使用Whisper-v3将模型的回应语音 wo 转为文字 c o co co。使用一个叫AudioReasoner的模型分析回应语音 wo 的说话风格,生成风格描述 s o so so。GPT-4打分:将输入的【内容ci、风格si】和模型输出的【内容co、风格so】一起喂给GPT-4.1,并附上一份详细的评分指南(r),让GPT-4.1给出一个1-5分的综合评分 fgpt。
    【实验证明,这个自动化评分 fgpt 与人类专家的评分高度相关(相关性 > 0.7)。】

AudioReasoner

  • AudioReasoner:是基于qwen-audio2 训练的,但是是另外一篇文章训练好的模型
    从 Gemini 蒸馏“思维链”(CoT)

目标:提升模型在处理音频时的推理能力,并减少幻觉(即胡说八道)。例如,当分析一个语音的语气时,模型不应该直接蹦出一个词(如“悲伤”),而应该能像人一样思考:“这个声音音调较低,语速很慢,内容是关于一次失败… 综合来看,情绪是悲伤的。” 这种一步步的思考过程就是“思维链”(Chain-of-Thought, CoT)。

“蒸馏”(Distilling):这是一个机器学习概念,可以理解为“让学生模仿老师”。在这里:

老师 (Teacher):是一个更强大、更昂贵的模型,即 Google 的 Gemini。
学生 (Student):是 Qwen-Audio 2。
训练过程:

研究人员向强大的“老师”Gemini 提出关于音频的问题(例如,“请分析这段语音的说话风格”)。
Gemini 不仅给出了最终答案,还输出了它详细的、一步步的思考过程(CoT路径)。
然后,研究人员用这些“思考过程”作为高质量的训练数据,来训练“学生”Qwen-Audio 2。
目标是让 Qwen-Audio 2 学会模仿 Gemini 的思考方式,从而自己也具备强大的推理和分析能力。

ParaS2SAlign:副语言感知S2S的强化学习框架:

  • 第一阶段:预热 (Warm-up / SFT),给基座模型(Kimi-Audio)补充副语言能力,SFT数据集(输入语音 -> 理想输出语音。经过这一步,模型初步具备了区分不同风格并做出不同反应的能力,虽然还不稳定。

  • 第二阶段:蒸馏奖励模型 (Distilling Reward Model)
    目的:创建一个快速、轻量的“AI裁判”,代替上面那个缓慢昂贵的“自动阅卷”流程。
    方法:用ParaS2SBench的“自动阅卷”流程为SFT模型的回复打分,构成一个庞大的“偏好数据集” Dprefer = {(输入语音, 输出语音, 分数)}。
    训练一个奖励模型ϕ(本文用的是Qwen2.5-Omni),让它学会预测ParaS2SBench会给出的分数。这个奖励模型输入一对语音,直接输出一个分数,速度非常快。

  • 第三阶段:后训练 (Post-training / GRPO)
    目的:利用快速的奖励模型,在大量无标签数据上进行强化学习,让模型能力持续进化。
    方法:使用一种名为 GRPO (Group Relative Policy Optimization) 的强化学习算法。
    流程:对于一个无标签的输入语音,让当前模型生成**一组(Group)**不同的回复。
    用奖励模型ϕ为这一组回复打分。
    通过比较组内各个回复的得分高低(相对优势),来调整模型策略,让模型更倾向于生成得分高的回复。
    为什么用GRPO:相比传统的PPO算法,GRPO更适合这种最终只有一个综合奖励的场景,并且计算和内存开销更小。

实验证明,RL方法比传统的监督微调(SFT)效果更好(在ParaS2SBench上提升11%)。
更重要的是,RL在数据效率上远超SFT。例如,仅用10小时的标注数据进行“预热”(warm-up),RL就能达到SFT用50小时数据才能达到的效果,大大缓解了数据稀缺问题。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐