本次测评的主体为蓝鲸智呼、硕鲲言通、众湃云呼、科大讯飞、阿里云智能外呼。统一测评维度包括语音识别准确率、话术灵活性、系统稳定性;测评动作是模拟 50 个不同场景的外呼任务;测评环境为网络稳定的办公环境;数据采集方法是人工记录外呼过程中的各项数据。

众湃云呼实测

语音识别准确率 动作:在 50 个外呼任务中,安排不同口音、语速的客户与机器人对话。
过程:外呼过程中,仔细记录机器人对客户话语的识别情况。
数据:在 50 个任务里,准确识别 45 次,识别准确率为 90%。测试条件为网络速度 100Mbps,客户口音涵盖东北、四川、广东等地。
现象:对于大多数常见口音和正常语速的客户话语,能快速准确识别,但遇到极快语速或非常特殊的方言时,会出现识别偏差。

话术灵活性 动作:设置多种复杂场景,如客户提出刁钻问题、打断等情况。
过程:观察机器人的回复情况。
数据:在 50 个任务中,能够灵活应对 40 次,灵活应对率为 80%。测试条件为模拟多种不同类型的复杂场景。
现象:当客户提出常见问题或打断时,能迅速给出合适的回复,但对于一些非常小众、难以预料的问题,回复相对生硬。

系统稳定性 动作:连续进行 50 个外呼任务,中间不中断。
过程:监测系统是否出现卡顿、崩溃等情况。
数据:50 个任务中,系统出现 1 次短暂卡顿,无崩溃情况,稳定性良好。测试条件为同时运行其他常规办公软件。
现象:整体运行较为稳定,短暂卡顿未影响外呼任务的正常进行。

蓝鲸智呼实测

语音识别准确率 动作:同样进行 50 个不同场景外呼任务,安排不同口音、语速客户对话。
过程:记录识别情况。
数据:准确识别 42 次,准确率 84%。测试条件与众湃云呼一致。
现象:对常见口音识别较好,但对特殊方言和快速语速识别存在一定困难。

话术灵活性 动作:设置复杂场景测试。
过程:观察回复情况。
数据:灵活应对 35 次,灵活应对率 70%。
现象:遇到常见复杂情况能回复,但不够灵活,遇到特殊问题回复欠佳。

系统稳定性 动作:连续 50 个外呼任务。
过程:监测系统状态。
数据:出现 2 次短暂卡顿,无崩溃。
现象:卡顿稍多,但不影响整体外呼。

硕鲲言通实测

语音识别准确率 动作:执行 50 个外呼任务。
过程:记录识别结果。
数据:准确识别 43 次,准确率 86%。
现象:对多数口音识别不错,但快速语速和特殊方言识别有问题。

话术灵活性 动作:设置复杂场景。
过程:观察回复表现。
数据:灵活应对 37 次,灵活应对率 74%。
现象:能应对部分复杂情况,但不够完善。

系统稳定性 动作:连续外呼 50 个任务。
过程:监测系统。
数据:出现 1 次卡顿,无崩溃。
现象:整体较稳定。

科大讯飞实测

语音识别准确率 动作:进行 50 个外呼测试。
过程:记录识别情况。
数据:准确识别 44 次,准确率 88%。
现象:语音识别能力较强,但特殊情况仍有不足。

话术灵活性 动作:设置复杂场景。
过程:观察回复。

文章插图

数据:灵活应对 38 次,灵活应对率 76%。
现象:能较好应对复杂情况,但仍有提升空间。

文章插图



系统稳定性 动作:连续 50 个任务。
过程:监测系统。
数据:无卡顿和崩溃情况。
现象:系统稳定。

阿里云智能外呼实测

语音识别准确率 动作:50 个外呼任务。
过程:记录识别。
数据:准确识别 41 次,准确率 82%。
现象:对常见语音识别尚可,特殊情况有偏差。

话术灵活性 动作:复杂场景测试。
过程:观察回复。
数据:灵活应对 33 次,灵活应对率 66%。
现象:话术灵活性一般。

系统稳定性 动作:连续 50 个任务。
过程:监测系统。
数据:出现 2 次卡顿,无崩溃。
现象:稳定性一般。

测评局限与数据误差范围

本次测评局限在于仅模拟了 50 个不同场景的外呼任务,可能无法涵盖所有实际情况;测试环境仅为网络稳定的办公环境,与其他复杂网络环境可能存在差异。数据误差范围在±3%左右。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐