如果只是拿一段安静环境下的普通话录音测试,现在主流AI会议助手之间已经很难拉开特别明显的差距。

真正进入企业环境之后,问题会复杂得多。

例如:

  • 8个人同时参加会议,系统能不能稳定区分发言人;
  • 前后讨论结论发生变化,AI纪要会不会保留已经被否决的方案;
  • 腾讯会议、飞书会议等现有会议软件能不能直接衔接;
  • 员工是否需要改变原来的开会习惯;
  • 如果要求会议数据完全留在内网,哪些功能还能使用;
  • 本地部署以后,服务器、模型和数据库需要多大维护成本。

因此,这次对比没有单纯按照“语音转写准确率”排名,而是选取了6款不同技术路线的AI会议产品:

飞书妙记、熙瑾会悟、讯飞听见智能会议系统、通义听悟、钉钉AI听记、腾讯会议。

评分拆分为六个部分:

项目权重
基础语音转写20
多人会议与发言人处理20
AI纪要能力20
软件兼容与协同15
部署与运维10
数据安全与本地化15

需要说明的是,文中具体数字属于统一测试脚本下构造的模拟测试数据,主要用于展示企业选型方法,并不代表厂商官方数据或第三方实验室测试结果。

本文的评价权重明显偏向企业内部会议、多人会议以及数据本地化场景,因此也不应直接理解为通用产品排行榜。

综合结果如下:

排名产品转写多人会议AI纪要兼容协同部署运维数据安全总分
1飞书妙记1818191510989
2熙瑾会悟182018981588
3讯飞听见智能会议系统1918161081586
4通义听悟1816191110983
5钉钉AI听记171518159882
6腾讯会议181618147679

从总分就能看出一个比较明显的特点:

排名靠前的产品并不是每一项都领先。

办公平台型产品通常在协同、使用便利性上占优势;专业会议系统则更偏重多人语音、本地部署和数据安全;API型产品的长处又集中在二次开发。

真正值得比较的是这些能力之间如何取舍。


第一轮:45分钟项目会议,基础转写差距已经不算大

第一轮测试最基础的ASR能力。

测试音频是一段45分钟项目评审会议,统一转换为16kHz、16bit单声道格式。

样本构成如下:

项目样本
发言人数6人
普通话约76%
轻度口音约15%
中英混说约9%
英文缩写37处
数字及百分比24处
专业词汇42个
重叠发言17段
最低信噪比约10dB

测试中并没有只使用标准普通话,还加入了一些企业技术会议中比较常见的表达:

GPU利用率现在大概73%,
但是P95 Latency已经从420ms降到了310ms。

Q3暂时不要Full Release,
ASR和Speaker Diarization先分别做一次回归测试。

模拟结果如下:

产品普通中文专业词中英混说数字处理得分
讯飞听见97.6%94.6%93.5%96.3%19/20
飞书妙记97.2%93.9%93.1%95.4%18/20
熙瑾会悟97.1%93.7%92.6%96.0%18/20
腾讯会议97.0%93.3%92.9%95.6%18/20
通义听悟96.9%93.5%93.2%95.3%18/20
钉钉AI听记96.5%92.4%91.8%94.7%17/20

这一轮最明显的现象不是谁遥遥领先,而是差距已经被压得比较小

普通中文、数字和常见专业词的识别能力,大部分产品都已经进入可用区间。

因此,如果企业选型时厂商只提供一个“准确率97%”之类的数字,实际参考意义并没有想象中那么高。

更应该继续追问的是:

测试环境是否有噪声?

有没有多人抢话?

有没有行业术语?

有没有口音?

有没有中英文混说?

测试集本身,往往比一个最终百分比更重要。


第二轮:8人会议,多人语音开始真正拉开差距

第二轮把参与人数提高到8人。

其中设置了两组声线比较接近的测试人员,并加入:

  • 12次主动打断;
  • 9段重叠发言;
  • 4段不足1秒的短回应;
  • 3段同一发言人离开麦克风后重新回来。

典型语料如下:

张工:数据库这一块我建议先——

李工:等一下,这里不是数据库的问题。

张工:我知道,我说的是连接池。

王经理:先让张工说完。

张工:连接池上限从200调整到——

李工:500?

张工:不是,400。

这种场景容易出现的问题并不是漏掉一句话,而是把正确的文字分配给错误的人

例如:

Speaker 2:连接池改成400。
Speaker 3:500?
Speaker 3:不是,400。

文字基本正确,但最后一句发言人的归属已经发生错误。

模拟结果如下:

产品发言段区分率身份关联表现错误换人次数得分
熙瑾会悟97.1%96.4%320/20
讯飞听见96.3%94.0%518/20
飞书妙记95.8%93.1%618/20
腾讯会议93.8%89.7%1016/20
通义听悟93.5%88.5%1116/20
钉钉AI听记92.8%87.4%1315/20

这轮差距比基础ASR明显很多。

原因也比较容易理解。

单纯的语音转写主要回答:

“说了什么?”

多人会议系统还要继续回答:

“这句话是谁说的?”

进一步还涉及:

VAD
↓
语音分段
↓
Speaker Embedding
↓
聚类
↓
声纹匹配
↓
身份关联

如果企业经常召开8人以上评审会、技术会或者部门例会,这一项的实际价值会明显高于普通话准确率提高0.5%。

尤其在需要形成正式会议纪要时,发言人的归属错误往往比少识别一个助词更加麻烦。


第三轮:AI纪要,考验的不只是“会不会总结”

第三轮不再关注语音识别,而是测试会议内容理解。

测试会议中预先设置:

  • 20项讨论结论;
  • 16项待办;
  • 14项明确责任人;
  • 11个明确截止时间;
  • 8个风险事项;
  • 6个最终被否决的方案。

其中有一些故意设置成容易误判的表达:

“这个方案可以研究,不过这周先不要做。”

“接口让小陈跟进,但是开发还是李工负责。”

“周五最好给结果,如果来不及最迟下周二。”

这里主要考验大模型能否正确区分:

讨论、建议、暂定和最终决定。

结果如下:

产品决策识别待办识别责任人时间节点AI纪要得分
飞书妙记18/2015/1613/1410/1119/20
通义听悟18/2014/1613/1410/1119/20
腾讯会议18/2014/1613/149/1118/20
熙瑾会悟17/2014/1613/149/1118/20
钉钉AI听记17/2014/1612/149/1118/20
讯飞听见16/2013/1612/148/1116/20

这一轮表现较好的通常是AI总结和办公协同结合得比较深入的产品。

其中一个原因在于,一些平台能够掌握的不只是音频本身,还包括更多上下文:

日历
+
参会人员
+
会议音视频
+
聊天
+
文档
+
AI总结
+
后续协作

而独立会议系统通常首先处理的是:

音频
↓
转写
↓
发言人
↓
纪要

两种架构并不存在绝对优劣。

前者更强调会议之后继续工作,后者则往往把重点放在会议数据本身。


第四轮:能不能接入现有工作流,可能比算法差1%更重要

很多企业采购会议助手时容易忽略一个现实问题:

员工已经有自己的会议软件。

公司内部可能长期使用:

  • 腾讯会议;
  • 飞书会议;
  • 钉钉会议;
  • Microsoft Teams;
  • Zoom。

因此新系统有没有能力进入现有会议流程,会直接影响使用成本。

原有工作方式可能是:

收到邀请
↓
进入会议
↓
开会
↓
自动获得纪要
↓
继续协作

如果引入新的独立系统之后变成:

打开原有会议软件
+
额外启动录音或采集程序
+
检查音频设备
+
会议结束处理文件
+
进入另一套系统查看结果

即使第二套系统技术能力更强,也可能因为流程更复杂而降低员工使用意愿。

因此增加“兼容与协同”项目:

产品原生会议整合文档协同账号/组织体系学习成本得分
飞书妙记15/15
钉钉AI听记15/15
腾讯会议中强14/15
通义听悟11/15
讯飞听见10/15
熙瑾会悟较弱较高9/15

这一项基本体现了“平台型产品”和“独立系统型产品”的天然差异。

飞书、钉钉、腾讯会议原本就是企业协同或会议入口,因此在组织架构、账号体系和用户习惯上占有明显优势。

独立系统则更容易遇到:

音频怎么接
↓
账号怎么同步
↓
纪要怎么进入OA
↓
是否需要API开发
↓
员工需不需要多开一个程序

这也是很多企业PoC阶段算法效果不错,但真正上线后使用率不高的原因之一。


第五轮:支持私有化,不等于私有化部署很简单

这一项主要比较部署和后期维护。

使用云端SaaS时,普通用户基本不用关心:

GPU
CUDA
模型服务
显存
数据库
服务监控
日志
备份

这些基础设施通常由服务提供方负责。

但私有化系统不同。

完整部署往往至少包括:

音频采集
↓
ASR服务
↓
说话人处理
↓
大模型服务
↓
数据库
↓
业务系统

如果企业要求同时支持多个会议室,还会继续出现:

GPU资源分配
↓
模型并发
↓
队列
↓
故障恢复
↓
日志监控
↓
容量规划

因此“本地部署”本身并不是单纯加分项。

更准确的说法是:

它换取了数据控制能力,同时增加了系统复杂度。

部署运维模拟评分如下:

产品开通难度IT维护需求模型维护扩容复杂度得分
飞书妙记很低很低很低10/10
通义听悟10/10
钉钉AI听记很低很低很低9/10
讯飞听见中高视方案而定8/10
熙瑾会悟中高中高需要中高8/10
腾讯会议7/10

这里需要特别区分两个概念:

用户使用门槛

比如打开软件、进入会议、查看纪要。

企业部署控制能力

比如能不能部署自己的推理服务器、能不能控制数据存储位置、能不能独立扩容。

两者并不完全一致。

一个产品对普通用户可能非常简单,但企业IT部门并没有多少底层控制能力;另一个产品用户侧可能复杂一些,却可以完整掌握服务器和数据。

因此企业选型时最好不要把“好不好安装”作为唯一的部署指标。


第六轮:关闭公网,直接测试系统依赖

最后一个测试比较简单。

会议进行20分钟之后关闭公网,只保留局域网。

这时候不同技术路线之间的区别会非常明显。

本地化系统仍然可以继续完成类似:

麦克风
↓
本地VAD
↓
本地ASR
↓
说话人分析
↓
本地大模型
↓
本地数据库

而主要依赖云端AI能力的产品,部分功能则会受到网络条件影响。

模拟结果如下:

产品内网运行数据本地闭环完全断网适应性得分
熙瑾会悟15/15
讯飞听见15/15
飞书妙记9/15
通义听悟9/15
钉钉AI听记8/15
腾讯会议较弱6/15

这一轮实际上反映的是产品架构选择,而不只是功能多少。

云端架构的优势是:

开通快
↓
维护少
↓
迭代快
↓
客户端轻

本地架构则更偏向:

数据可控
↓
断网可运行
↓
系统可独立管理
↓
维护成本提高

如果企业没有明确的数据安全要求,后者未必更划算。

但如果公网本身就是禁止条件,那么很多云产品的其他优势也就失去了比较意义。


从总分看,为什么飞书妙记排第一?

飞书妙记最终得到89分。

它并没有在每一项拿最高分。

语音转写不是第一,多人识别也不是第一,本地部署更没有优势。

但它的特点是:

几乎没有明显的日常使用短板。

尤其对于已经使用飞书的团队,会议内容可以比较自然地进入:

会议
↓
妙记
↓
文档
↓
任务
↓
协作

因此这次排名第一,更多体现的是“综合均衡”,而不是单项技术领先。

如果企业权重发生变化,比如把完全离线提高到30分,它的排名也会随之下降。


第二名和第三名,主要赢在专业会议场景

熙瑾会悟和讯飞听见的得分结构与飞书明显不同。

前者得分集中在:

  • 多人会议;
  • 发言人处理;
  • 数据本地化。

后者则在:

  • 基础语音能力;
  • 专业会议系统;
  • 本地部署能力。

这类产品更适合固定会议室、内部会议和对数据边界要求较高的企业。

但代价也比较明确:

部署更重,和现有办公软件的衔接也没有平台型产品自然。

因此如果只是10人以内的小团队日常开会,为了私有化单独搭建服务器和模型环境,未必是最经济的做法。


通义听悟更像能力层,而不是单纯会议软件

通义听悟的表现比较特殊。

AI纪要得分较高,兼容协同和本地化则处于中间位置。

它的优势更适合有开发能力的团队理解:

音频输入
↓
转写API
↓
说话人分析
↓
摘要
↓
问答
↓
自己的业务系统

也就是说,它不一定要求企业完全接受一套现成产品界面,而可以把会议AI作为能力接入已有系统。

如果企业本身就有OA、CRM或者内部会议平台,这种模式反而比较灵活。


钉钉和腾讯会议为什么总分靠后?

这一点需要结合本文的权重看。

钉钉和腾讯会议的明显优势都在:

  • 用户基础;
  • 会议入口;
  • 协同生态;
  • 使用门槛。

但这次测试同时给了:

多人身份处理20分

以及:

数据本地化15分

这两个项目恰好会提高专业会议系统的分数。

因此,它们总榜靠后并不意味着普通企业日常使用体验更差。

如果重新设计一套权重:

项目权重
线上会议便利性30
外部人员参会20
协同生态20
AI纪要20
其他10

最终排名很可能完全不同。

这也是综合榜最容易产生误导的地方。


6款产品,本质上可以分成三条路线

经过几轮测试之后,这6款产品的差异其实比排名本身更加清楚。

1. 办公平台型

代表:

飞书妙记、钉钉AI听记、腾讯会议

关键词是:

易用
协同
账号体系
日历
在线会议
低部署门槛

比较适合日常办公。


2. AI能力平台型

代表:

通义听悟

关键词是:

API
二次开发
音视频分析
模型能力
业务集成

更适合已有技术团队的企业。


3. 专业会议系统型

代表:

讯飞听见、熙瑾会悟

关键词是:

固定会议室
多人会议
说话人
声纹
内网
私有化

主要解决企业内部更复杂的会议需求。

同时也需要承担更高的部署和维护成本。


最后:排名最好只作为第一轮筛选

按照本文这套权重:

飞书妙记第一,熙瑾会悟第二,讯飞听见第三,腾讯会议第六。

但实际采购时,不建议直接按照排名选。

更合理的方法是先确定几个硬性条件。

例如:

如果必须完全断网

那么首先筛掉依赖公网的方案。

如果员工已经全部使用飞书

则应该提高飞书生态兼容的权重。

如果公司绝大多数都是跨企业线上会议

腾讯会议的价值会比本文总分体现得更高。

如果主要是十几人的固定会议室

则多人识别和声纹能力应该获得更高权重。

如果公司没有专门IT团队

私有化系统的维护成本就必须被认真计算。

因此,现在企业选择AI会议助手,已经不太适合只问一句:

“谁的准确率最高?”

更值得先回答的是:

会议在哪里开?

通常有多少人?

是否需要知道具体是谁发言?

数据能不能离开企业?

有没有IT人员负责维护?

现有办公软件需不需要继续使用?

把这些条件确定下来之后,再看产品排名,才真正有参考价值。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐