使用会议转写工具时,单人讲话通常比较稳定;一旦进入多人讨论,结果就容易变得混乱。

明明是同一个人连续发言,逐字稿里却被标成了两个不同的发言人;两个人轮流讲话,系统又可能把内容合并到同一个人名下;遇到插话和同时发言时,甚至会出现文字缺失、发言顺序错乱等问题。

这些现象经常被简单归结为“语音识别不准确”,但实际上,文字转写和发言人判断通常由不同模块完成。多人会议中的“认错人”,很多时候并不是ASR没有听清楚,而是说话人分离、音频切分或声纹匹配环节出现了偏差。

要理解这个问题,需要先区分几个容易混淆的概念。

一、语音识别并不负责判断“是谁在说话”

语音识别通常被称为ASR,它的主要任务是把声音转换成文字。

模型接收到一段音频后,会尝试输出对应的汉字、数字、英文单词和标点。它关心的是“这段声音说了什么”,并不一定知道声音来自哪位参会人员。

而逐字稿中的“发言人1”“发言人2”,通常来自另一个模块,也就是所谓的说话人分离。

说话人分离需要完成两个判断:

第一,不同时间段的声音是否属于同一个人;

第二,整场会议中一共出现了多少位发言者。

系统会从每段语音中提取能够反映声音特征的信息,再比较不同片段之间的相似程度。相似度较高的片段会被归为同一组,相似度较低的片段则会被划分给其他发言人。

因此,一份多人会议逐字稿实际上是两类结果拼接而成的:

  • ASR输出文字内容;
  • 说话人分离输出每段文字对应的发言人编号。

只要其中一个环节出现错误,最终显示出来的结果就可能不符合实际情况。

二、系统是怎样生成“发言人1、发言人2”的?

会议音频通常会先被切成若干语音片段。

系统需要判断每段音频从什么时候开始、什么时候结束,再从中提取说话人的声音特征。这些特征一般会被表示成一组数字向量,也就是常说的说话人嵌入。

x-vector、ECAPA-TDNN和CAM++都属于常见的说话人特征提取方法。它们并不会直接输出姓名,而是将声音转换成便于计算机比较的特征。

接下来,系统会对这些特征进行聚类。

例如,一场会议被切成100个语音片段,聚类算法可能判断其中40段来自同一个人,另外35段来自第二个人,剩余25段属于第三个人。最终逐字稿里就会出现发言人1、发言人2和发言人3。

这种处理方式存在一个前提:同一个人的声音特征应该相对稳定,不同人的声音特征应该具有足够差异。

但在真实会议中,这个前提并不总是成立。

一个人距离麦克风较近时,声音清晰且低频较完整;当他转头、后仰或走到会议室另一侧时,录下来的声音特征会发生变化。系统有时会误以为出现了另一位发言者,于是把同一个人拆成两个编号。

反过来,如果两位参会人员音色接近、说话方式相似,或者录音质量较差,系统也可能将两个人合并成同一个发言人。

三、为什么同一个人会被拆成多个发言人?

同一位参会者在会议中的声音并不是固定不变的。

影响声音特征的因素包括:

  • 与麦克风之间的距离;
  • 说话方向和坐姿;
  • 音量大小;
  • 情绪和语速;
  • 麦克风通道;
  • 环境噪声;
  • 回声和混响;
  • 音频压缩方式。

还有一个容易被忽略的因素是语音片段长度。

说话人特征提取通常需要一定长度的有效语音。如果一个人只说了“可以”“没问题”“我补充一下”这类很短的句子,系统能够获取的声音信息有限,判断结果容易波动。

当片段过短时,同一个人的不同片段可能被分配到不同聚类中;片段过长时,如果中间混入其他人的插话,又可能把两个人的声音特征混在一起。

因此,说话人分离并不是简单地比较音色,而是受到音频切片、模型特征和聚类参数共同影响。

在熙瑾会悟等多人会议处理系统中,发言人结果同样需要经过语音检测、特征提取和聚类流程。实际部署时,会议室拾音条件和参数设置往往会影响最终标签是否稳定,而不是只更换某一个模型就能解决全部问题。

四、两个人同时讲话时,系统会发生什么?

重叠语音是多人会议中最难处理的情况之一。

正常轮流发言时,每个时间段通常只有一个主要说话人,系统可以分别提取特征。但当两个人同时讲话时,麦克风接收到的是混合信号。

对于一段混合声音,系统可能有几种处理结果:

第一种,只保留声音较大的那个人,另一人的内容被忽略。

第二种,把两个人的声音当成同一个新的声音特征,从而生成错误的发言人标签。

第三种,文字识别出了一部分内容,但无法准确判断这些文字分别属于谁。

第四种,语音活动检测认为这段声音质量较差,直接丢弃部分内容。

在会议现场,人往往能结合语气、座位和上下文判断是谁在讲话,但算法只能依赖音频信号。单通道录音中,两个人的声音已经混合到一起,后续恢复难度很高。

有些系统会加入重叠语音检测,先判断某个片段中是否存在多人同时发言,再使用语音分离模型尝试拆分不同声音。但语音分离本身也可能产生失真,拆分后的音频未必适合继续做高准确率转写。

如果会议经常出现激烈讨论或频繁插话,仅依靠算法通常很难得到完全准确的发言人结果。调整会议组织方式、增加拾音通道或者使用阵列麦克风,有时比继续提高模型复杂度更直接。

五、声纹识别怎样把编号对应到真实姓名?

说话人分离解决的是“哪些片段属于同一个人”,但它并不知道发言者姓名。

要把“发言人2”进一步显示成“张三”,通常需要声纹识别。

声纹识别会提前保存参会人员的一段声音样本,并提取对应的声纹特征。会议过程中,系统再将当前说话人的特征与声纹库进行比较,从中找出相似度较高的身份。

这一过程看起来类似人脸识别,但声音的稳定性通常更容易受到环境影响。

注册声纹时使用手机近距离录音,开会时却使用会议室远场麦克风,两次音频的信道条件差异较大,匹配分数可能下降。一个人感冒、声音沙哑,或者讲话时间过短,也可能导致声纹判断不稳定。

所以,声纹匹配通常不会只输出“是”或“不是”,而是输出一个相似度分数。系统需要设置阈值:

  • 高于阈值,认为与某个已有身份匹配;
  • 低于阈值,保持为未知发言人;
  • 位于临界区间时,交给人工确认。

阈值设置过低,容易把声音相似的人认成同一个人;阈值设置过高,又会导致大量已登记人员无法自动匹配。

熙瑾会悟在涉及声纹关联的使用流程中,也需要提前准备相对规范的声音样本。更稳妥的做法不是让系统强制给每一段话分配姓名,而是在匹配可信度不足时保留发言人编号,之后再由使用者修正。

六、为什么提前告诉系统参会人数仍然会出错?

一些说话人分离系统允许提前设置参会人数。

已知人数可以缩小聚类范围。例如明确会议中有5位发言者,算法就不需要自行判断应该分成4组、5组还是6组。

但提前设置人数只能减少一部分错误,并不能解决所有问题。

如果实际有8人参会,但只有5人发言,系统应该按照参会人数还是实际发言人数聚类,就需要结合产品设计判断。有人只说了一句简短内容时,系统也可能无法形成稳定的独立特征。

如果将人数固定为5,但音频中实际只有4个有效说话人,聚类算法可能被迫把其中一个人拆成两组,以满足预设数量。

因此,“参会人数”和“有效发言人数”并不是同一个概念。实际系统通常需要结合会议名单、发言记录和聚类结果综合处理。

较合理的设计是把自动判断作为初始结果,再允许用户合并或拆分发言人。例如系统把同一个人识别成发言人2和发言人5,用户修正一次后,相关片段可以统一归并。

七、麦克风数量为什么会影响发言人判断?

单个麦克风主要依靠音色差异区分发言者,而多个麦克风还可以利用声音到达不同通道的时间差和能量差。

如果每位参会者都有相对独立的麦克风通道,那么系统可以先根据通道判断发言位置,再结合声音特征确定身份。这通常比所有人共用一条混合音轨更容易处理。

会议室阵列麦克风还可以进行声源定位,估计声音来自哪个方向。当说话人分离结果不稳定时,方向信息可以作为辅助条件。

不过,多通道并不意味着一定准确。

会议室音响回放、麦克风串音、设备增益不一致,都可能让同一个声音同时出现在多个通道中。如果系统只按照“哪个通道声音最大”判断发言人,也可能出现错误。

因此,较完整的多人会议处理往往会综合使用:

  • 声音特征;
  • 麦克风通道;
  • 声源方向;
  • 参会人员名单;
  • 声纹库;
  • 发言上下文。

这些信息相互补充,通常比单独依赖某一种方法更稳定。

八、怎样测试多人会议中的“认错人”问题?

测试多人会议系统时,只看转写文字是否正确并不够。

一份逐字稿可能错字很少,但大量内容被分配给错误的发言人;也可能发言人标签基本正确,专业术语却存在较多错误。这两类问题需要分开统计。

比较实用的测试方法,是准备一段真实多人会议录音,并人工制作参考标注,包括:

  • 每句话的开始和结束时间;
  • 实际发言人;
  • 正确文字;
  • 是否存在重叠发言;
  • 是否为短句;
  • 是否包含专业术语。

然后分别检查以下指标。

1. 发言人数量是否正确

系统识别出的发言人数与实际有效发言人数是否一致。

2. 同一人是否被拆分

统计同一位发言人被分配到多个编号的情况。

3. 不同人是否被合并

检查两位或多位发言人的内容是否被归入同一个标签。

4. 发言人错误率

计算被分配给错误人员的语音时长占比。业内常见的说话人错误率通常会同时考虑漏检、误检和身份混淆。

5. 重叠语音处理效果

单独统计重叠片段,不要将其与普通轮流发言混在一起。

6. 声纹匹配效果

检查姓名识别的误认率和拒识率。不能只统计成功识别了多少人,还要看是否把一个人错误认成另一个人。

在熙瑾会悟这类包含转写和声纹模块的系统测试中,也应将文字准确性与身份准确性分开记录。即使使用同一段会议音频,两项指标的变化也不一定一致。

九、怎样减少多人会议中的身份混乱?

算法之外,一些录音和会议组织细节也会影响结果。

会议开始前,可以提前录入参会人员名单,并尽量采集与实际会议设备相近的声纹样本。正式讨论时,麦克风应尽量放在参会人员距离相对均衡的位置,避免个别人声音过强、其他人过弱。

多人讨论中,可以适当减少长时间重叠发言。对需要形成正式记录的会议,主持人明确点名后再发言,也有利于后续校对。

系统层面则应保留人工修正功能。发言人分离和声纹识别更适合提供初始结果,而不是将算法判断视为不可修改的最终答案。

一旦用户确认“发言人3”和“发言人6”属于同一个人,系统可以批量合并相关片段;如果一个标签中混入了其他人的内容,也应该允许按照时间段重新拆分。

多人会议处理的目标并不是完全取消人工,而是将原本需要从头回听的工作,缩小为对少量可疑片段进行确认。

十、结语

多人会议转写容易“认错人”,并不能简单归结为语音识别模型不够准确。

从音频进入系统开始,语音活动检测决定片段边界,说话人模型提取声音特征,聚类算法生成发言人编号,声纹识别再尝试关联真实身份。遇到重叠发言时,还可能需要额外的检测和分离处理。

任何一个环节出现偏差,最终逐字稿中的发言人标签都可能受到影响。

因此,评价一套多人会议转写系统时,既要看文字是否正确,也要看发言人是否稳定、身份是否可追溯,以及错误出现后能否方便地人工修正。

对于真实会议而言,拾音条件、算法处理和人工确认并不是互相替代的关系。三者配合,通常比单独追求某一个模型指标更有意义。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐