Android纯手机实现意图判断型AI

--进行电话拨打和AI语音电话沟通

  • 一、前言

现在市面上,涉及到语音相关的大模型,基本都是在线的、收费的。只要在声音拾取的过程中关闭WIFI/5G,那么声音转文字(ASR)识别的效果就非常拉跨,包括但不限于手机自带的输入法、录音机、聊天软件、会议记录等应用都是如此。

这就会造成一个信息边界和数据安全的问题,特别是对于电话通话领域。同时,由于通话交互过程中引入了网络环节的因素,通话质量和交互效果会受到网络扰动的影响。

对于真正的终端手机用户而言,只要涉及到理解对方电话里说话的内容,哪怕只有这么个简单的需求,都要把语音传递给云服务器,让它全权介入跟对方做AI通话,感觉怪怪的。这不仅是数据安全问题,而是一个数据主动权的问题。

那么有没有办法将AI直接移植到手机上,来电话了或外呼拨打时,通话自动在手机本地进行AI处理和语音应答呢?如果不要求太复杂的功能,只做类似开场白这种SayHello的智能IVR语音菜单应答这样的逻辑是否可行?

  • 二、手机本地ASR识别通话内容

前面的篇章中,我们介绍了在Android手机上,使用SenseVoice来进行离线语音识别,它默认支持【简体中文-zh】、【英语-en】、【日语-ja】、【韩语-ko】、【粤语-yue】这几种语言的声音转文字的能力。

它依赖一个约130MB大小的量化后的模型库,占用运行内存大约500MB,文字响应约0.4秒。识别和响应的速度还不错。

体验和下载地址如下:http://120.78.211.195:8060/asr.apk

依托于这个手机本地的ASR,我们如何用它构建一个【意图判断型AI】来做智能应答呢?

  • 三、从ASR文字提取关键字
  • 四、从关键字识别意图

我们为了将用户说话的反馈进行较为精准的匹配,仅靠单个的关键字进行定位不够,这里采用聚类的办法,将常用的相近意思的关键词聚类成【意图】的概念来做行为识别。

当电话对方说的内容,匹配到关键字对应的意图时,就会像IVR语音菜单那样,按下“数字按键”就触发对应的语音节点和行为事件进行联动。如下图所示:

  • 五、其余章节

由于篇幅有限,详细的文章内容写到了头条的文章中,感兴趣的读者可以自行查阅:

https://www.toutiao.com/article/7683150636581454378

  • 八、小结

由于电话通话数据不传出手机,在数据安全性与合法合规方面,能够得到更大的保障。同时,由于所有语音都在手机本地进行识别和判断,不需要手机网络的参与,在应答的响应速度和“端到端”的实时性上能够有更好的表现。

最后,由于ASR(语音转文字)选用的SenseVoice,模型文件和运行库非常的小(约130MB),完全加载后做上行和下行两个并发识别也仅占用500MB左右的运行内存。市面上绝大多数二手Android手机,均能正常的运行和使用这个方案。极大的降低了使用难度、提升了方案的产品覆盖面。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐