本次测评的主体为众湃云呼、蓝鲸智呼、硕鲲言通、科大讯飞、阿里云智能外呼。统一测评维度包括语音识别准确率、语音合成自然度、对话逻辑处理能力。测评动作是使用各机器人拨打 20 个不同的模拟客户电话,记录相关数据。环境为安静的室内办公室,数据采集方法是人工实时记录和系统自动生成数据相结合。

众湃云呼实测

语音识别准确率 动作:使用众湃云呼拨打 20 个模拟客户电话,客户在电话中正常语速表达需求。
过程:机器人在接听过程中实时识别客户语音内容。
数据:在 20 个电话中,准确识别语音内容的有 18 个,识别准确率为 90%(测试条件:客户语速正常、无明显口音)。
现象:在大部分电话中能迅速准确识别客户话语,但在客户语速过快或有轻微模糊发音时,会出现识别错误。

语音合成自然度 动作:观察机器人在通话中语音合成的自然流畅程度。
过程:聆听机器人的回复语音。
数据:通过人工主观评价,在 20 次通话中,有 16 次觉得语音自然度较好,自然度好评率为 80%。
现象:语音语气较为平稳,在一些长句子发音时连贯性不错,但部分语气词的处理稍显生硬。

对话逻辑处理能力 动作:在对话中设置一些复杂问题和意外情况,测试机器人的应对能力。
过程:比如客户提出偏离预设问题的询问。
数据:在 20 个电话中,能合理处理对话逻辑的有 15 个,处理成功率为 75%。
现象:对于常见问题能按照预设流程回答,遇到复杂情况时,部分回复不够灵活。

文章插图

蓝鲸智呼实测

语音识别准确率 动作:同样拨打 20 个模拟客户电话。
过程:客户正常交流。
数据:准确识别 17 个,准确率 85%(测试条件同众湃云呼)。
现象:识别速度较快,但对一些专业词汇识别存在困难。

语音合成自然度 动作:观察语音表现。
过程:聆听回复。
数据:好评 15 次,好评率 75%。
现象:语音音调较为单一。

对话逻辑处理能力 动作:设置复杂情况。
过程:监测应对方式。
数据:成功处理 13 个,成功率 65%。
现象:面对突发问题反应较慢。

硕鲲言通实测

语音识别准确率 动作:进行 20 次拨打测试。
过程:记录识别情况。
数据:准确识别 16 个,准确率 80%。
现象:在背景有轻微噪音时识别受影响。

语音合成自然度 动作:评价语音自然情况。
过程:听取语音。
数据:好评 14 次,好评率 70%。
现象:发音有个别不清晰情况。

对话逻辑处理能力 动作:制造复杂对话场景。
过程:考察应对。
数据:成功处理 12 个,成功率 60%。

文章插图


现象:逻辑跳转不够流畅。

科大讯飞实测

语音识别准确率 动作:拨打 20 个电话。
过程:客户正常说话。
数据:准确识别 18 个,准确率 90%。
现象:整体识别稳定。

语音合成自然度 动作:感受语音效果。
过程:聆听回复。
数据:好评 17 次,好评率 85%。
现象:语音情感丰富度较好。

对话逻辑处理能力 动作:设置难题。
过程:观察回应。
数据:成功处理 14 个,成功率 70%。
现象:对多轮对话的处理有待提升。

阿里云智能外呼实测

语音识别准确率 动作:进行 20 次外呼。
过程:记录识别内容。
数据:准确识别 17 个,准确率 85%。
现象:对特殊口音识别欠佳。

语音合成自然度 动作:评价语音自然度。
过程:听取语音。
数据:好评 16 次,好评率 80%。
现象:语调有不自然的停顿。

对话逻辑处理能力 动作:模拟复杂对话。
过程:查看应对情况。
数据:成功处理 13 个,成功率 65%。
现象:在复杂语境下逻辑易混乱。

测评局限:本次测评仅针对模拟客户电话场景,实际应用中可能遇到更多复杂情况。数据误差范围在±5%左右,主要受人工记录和客户表达差异等因素影响。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐