课堂录音太嘈杂,用目标说话人技术只转录老师板书时的讲解
课堂录音的痛点:为什么传统 ASR 救不了场
做过课堂笔记的人都有过这种体验:回听录音时,老师的声音和周围一切混在一起——前排同学的窃窃私语、后排翻书的沙沙声、走廊里偶尔传来的动静,甚至空调运转的低频噪音。传统 ASR 模型不管这些,它会把所有能识别的语音一股脑转写出来,结果就是一份充斥着"嗯""这个""那个"以及大量无关对话的文字稿,真正需要的内容反而被淹没了。
更麻烦的是课堂特有的动态性。老师从讲台走到学生中间,麦克风距离变化导致音量忽大忽小;学生集体回答问题时,多个声音重叠;课间休息回来,设备没关又录了一段无关内容。这些场景对 ASR 的挑战不是"听不清",而是"听太杂"——模型缺乏区分"谁在说"的能力,只能被动接收所有声源。
目标说话人技术:从"全量收声"到"指哪打哪"
小米最近开源的 CocktailASR-1 换了个思路。它没有走"先做降噪、再做识别"的老路,而是把任务定义改成目标说话人语音识别:先给模型一段参考音频,让它记住这个声音的特征,然后在后续录音中只转录这个人的语音,其他人的声音、背景噪音、混响统统过滤掉。
这个思路很符合人的听觉习惯。想象一下在嘈杂餐厅里,你能轻易从周围几桌的谈话中锁定朋友的声音,靠的不是把环境变安静,而是大脑对特定声纹的持续关注。CocktailASR-1 做的就是这个事,只不过对象换成了课堂场景中的教师声音。
参考音频从哪来
实际用起来,获取参考音频的方式很灵活。课前单独录一段教师自我介绍是最直接的,十几秒就够,关键是包含稳定的声纹特征。更省事的做法是直接用课程开头的片段——大多数老师开场会有固定的自我介绍或课程概述,截取这部分作为参考音频,省去了额外录制环节。
对于连续多节课的场景,参考音频甚至可以复用。只要教师没有明显感冒或设备更换,同一参考音频支撑一整天的课程转写通常没问题。如果中间有较长时间间隔,或者换教室导致录音设备变化,补录一段新的参考音频就能保持效果。
端到端架构:一个模型包圆,不用拆东墙补西墙
CocktailASR-1 的架构设计比较简洁:D2V2 音频编码器负责把音频转成特征,Adapter 做适配,最后接 LLM 解码。所有权重放在一个 checkpoint 里,输入时把参考音频和目标音频拼接,中间插一秒静音分隔,16kHz 单声道即可。
这种端到端设计的好处是不用为不同场景换模型。传统方案里,单人讲话用一个模型,多人场景换另一个,噪音大了再换降噪模块,实际部署起来很繁琐。CocktailASR-1 把参考音频作为条件输入,单人讲课、多人讨论、甚至教师走动导致声学环境变化,同一个模型都能处理。教师从讲台走到教室后排,距离麦克风远了、混响变了,模型依然能靠声纹特征锁定目标,不会因为音量降低就漏掉内容。
相比"降噪+识别"的串联方案,端到端架构的鲁棒性体现在错误不会逐级放大。传统流程里,降噪环节把教师声音误当成噪音削掉,后面识别再好也救不回来;或者降噪不足,残留噪音干扰识别。目标说话人技术直接把"只关注谁"作为输入条件,绕开了这个困境。
负样本拒识:集体回答时不再乱转写
课堂里有个特殊场景:教师提问后,学生集体回答。这时候传统 ASR 会忠实转写所有声音,输出一片混乱的文本。CocktailASR-1 的负样本拒识能力在这里就很有用——当参考音频对应的人(教师)没有说话时,模型输出空文本,而不是把周围学生的七嘴八舌硬转成文字。
测试数据上看,这项能力的准确率相当可观:LibriSpeech 负样本拒识率 79.59%,Aishell 上 75.35%,小米自有的中文测试集上 68.54%。作为对比,Qwen3-ASR 和 StepAudio 目前不具备这个能力。实际课堂中,这意味着学生讨论环节不会混入转写结果,最终文稿的纯净度大幅提升。
当然,68%-79% 的拒识率也意味着有优化空间。如果课程设计里需要记录学生发言,目前的方案还需要配合其他手段,比如单独给学生准备参考音频,或者事后人工标注。但对于"只保留教师讲解"这个核心需求,现有能力已经能过滤掉大部分干扰。
思维链推理:让转写过程可解释
CocktailASR-1 另一个有意思的特性是思维链推理。模型在输出最终转写结果前,会先展示一段推理过程,比如判断"当前片段是否属于目标说话人""这段音频是有效语音还是背景噪音"。
对课堂场景来说,这相当于给转写结果加了层"审计日志"。如果某段内容转写异常——比如突然漏掉几句话,或者出现了明显不属于教师的词汇——可以回溯推理过程,看是模型判断目标说话人不在场,还是把其他声音误识别了。这种可解释性在调试和优化工作流时很有价值,不用对着黑盒猜测。
从实际测试看,开启思维链对最终精度的影响很小,几乎可以忽略。所以如果系统资源允许,建议保持开启,尤其是转写质量需要人工复核的场景。
中文课堂适配:自研测试集的意义
前面提到小米在自有中文测试集上做了测试,这个细节值得展开。中文课堂场景和英文语料差异不小:普通话的声调变化、课堂里常见的方言口音、中文特有的语速和停顿习惯,都需要模型在训练阶段有足够覆盖。
CocktailASR-1 在中文测试集上的表现(WER 及拒识率)说明其训练数据里包含了相当比例的中文语料,不是简单把英文模型搬过来。对于国内在线教育、高校课堂录制等场景,这意味着开箱即用的可能性更高,不需要像某些海外模型那样先做大量本地化适配。
实际部署时,如果教师有较重口音或习惯使用特定术语,可以在参考音频里多覆盖一些这类样本,或者课后用少量数据做轻量级微调,进一步提升准确率。
一个可落地的课堂转写工作流
把以上特性串起来,可以设计这样一个流程:
课前准备:录制或截取 10-20 秒教师参考音频,存为课程档案。同一学期同一教师可复用。
录制阶段:正常开启课堂录音,无需特殊设备,普通领夹麦或手机录音即可。教师走动、学生讨论都不影响,模型只关注目标声纹。
转写阶段:输入参考音频+目标音频,CocktailASR-1 自动过滤非目标语音。开启思维链,保留推理日志备查。
后处理:对输出文本做段落和标点优化,结合时间戳生成可检索的课程文稿。学生集体回答的片段自然留白,不会混入噪音转写。
这个流程的核心优势是低侵入性:教师不需要改变授课习惯,不用佩戴特殊设备,学生讨论也不会被压制。技术层面把复杂度留给了模型,使用层面保持简单。
局限与权衡
任何技术都有边界。CocktailASR-1 目前的表现依赖参考音频的质量,如果录制时环境过于嘈杂,或者教师声音被严重遮挡,参考声纹的纯净度会受影响。另外,极端多人同时讲话且声纹特征接近的场景(比如双胞胎学生同时发言),模型区分能力会下降,不过这类情况在常规课堂中较少见。
另一个现实考量是计算资源。端到端大模型相比传统轻量 ASR,推理延迟和硬件要求更高。对于实时字幕这类强时效场景,需要评估部署成本;课后离线转写的场景则完全适用。
写在最后
课堂录音的价值在于把一次性的听觉信息转化为可检索、可复习的文字资产。传统 ASR 做到了"能转",但距离"好用"还有距离。CocktailASR-1 代表的方向——用目标说话人技术精准锁定信息源——让课堂转写从"全量收录"走向"按需提取",实际解决的是信息过载而非信息不足的问题。
对于每天面对大量课程资料的学生,或者需要管理海量教学内容的在线教育从业者,这种"只转录该转录的"能力,可能比追求绝对最低的词错率更有实用价值。毕竟,一份干净的、属于教师的讲解文稿,远比一份混杂了所有背景噪音的"完整"记录更有复习意义。
更多推荐


所有评论(0)