最近有朋友问我,如果想给自己的产品加一个能"直接说话"的 AI 助手,有没有什么方案是开箱就能跑的?

顺着这个问题,我翻到了 Agora Conversational AI。

Agora垃圾分类Agent

Agora 做实时音视频出身,底层 RTC 网络遍布全球。2024年 OpenAI 发 GPT-4o 的实时语音能力时,早期方案用的是 WebSocket,网络抗性不太行。到了 2024 年 10 月,OpenAI 官宣 Agora 作为 Realtime API 的首批官方合作伙伴——说白了,语音智能体需要一个靠谱的实时传输层,而 Agora 有现成的 RTC 网络。

这是官网的截图,能看到 官网明确指出“Build Real-time Voice Al, Avatars, &Conversational loT”(构建实时语音 AI、虚拟形象及对话式物联网应用):

Agora 官网

官方文档里对语音 Agent 的概念拆解和上手路径都写得很清楚:

Agora 官方教程


上手第一印象

必须是安装非常简单!

Agora 提供了一套 CLI,Windows 上一条命令装完:

irm https://dl.agora.io/cli/install.ps1

安装 Agora CLI

然后装 Agora Skills,方便我用 Claude Code 直接理解 Agora 的 API 和项目结构。装完之后给一句 prompt,工具就能自动搭项目,不需要自己翻文档拼代码:

npx skills add AgoraIO/skills

安装 Agora Skills 1

安装 Agora Skills 2

装完后跑了一个 Python 版的 Quickstart,这是它的项目结构:

Python Demo 项目结构

启动也很直接:

启动 Demo


最反直觉的事

这里有一个点我觉得值得单独拿出来说。

以前要跑通一个语音 AI 对话 demo,你得先去 OpenAI 申请 Key,再去 Deepgram 或者 Azure 申请语音服务 Key,一套下来少说折腾半小时。但 Agora 的 Quickstart 后端是 keyless 的——注册后有 300 分钟免费额度,预置了 STT / LLM / TTS,开箱就能说话,不需要自己配任何第三方 Key。

这个确实有点反直觉,我一开始还不信,直到浏览器打开 localhost:3000 看到这个界面:

Demo 首页

点了一下 Start Conversation,直接就能说话,全双工让我感觉在和AI实时对话:

对话交互界面

这个体验确实不错。当然,后面如果要换自己的模型,Agora 也支持替换成自托管的模型。


实际聊起来的感受

全双工这个特性,实际体验和半双工差别很大。

半双工是什么感觉?你说完,等两秒,AI 开始说,你再等它说完。期间如果你插话,它听不见,或者直接乱掉。

Agora 的做法用了 turn detection(语义轮次检测),它会根据语义判断你是不是说完了,不是说一停就以为你结束了。我试了几次说到一半改口的情况,它都能跟住,没有出现那种"我还没说完它就抢话"或者"我停了两秒它就开始自说自话"的问题。

另外Agora端到端的延迟仅 650ms,实际聊下来没有明显的等待感,更关键的是,Agora 的 RTC 网络遍布全球,上线后全球用户都能保持这个水平,而不是只有你在本地跑 demo 时快。


实战:用 Claude Code 搭了个垃圾分类语音助手

光跑 Demo 不过瘾,我试着用 Claude Code + Agora Skills 做了一个垃圾分类语音助手。

代码基本是 Claude Code 自动生成的,我只需要告诉它我要做什么、设定好分类规则就行:

Claude Code 开发垃圾分类 Agent

系统提示词设了中国垃圾分类四分类标准:

  • 可回收物 —— 废纸张、废塑料、废玻璃、废金属等
  • 有害垃圾 —— 废电池、废灯管、废药品等
  • 厨余垃圾(湿垃圾)—— 食材废料、剩菜剩饭等
  • 其他垃圾(干垃圾)—— 纸巾、尘土、一次性餐具等

启动后访问 localhost:3000

垃圾分类 Agent 启动

我用语音问它:“矿泉水瓶是什么垃圾?”

Agent 回复:“矿泉水瓶属于可回收物,因为它是由塑料制成,适宜回收利用,请确保瓶子内无剩余液体,并尽量压扁后投放。”

与垃圾分类 Agent 对话

全程语音交互,不用打字。


控制台和用量监控

Console 里能看到密钥、免费额度用量这些基本信息:

Agora 控制台

Analytics 页面能看到更详细的调用数据,比如延迟分布和调用次数:

Analytics 调用详情


一些主观感受

好的地方:

  1. Keyless 开箱能说话——这个确实省了很多前期配置的功夫
  2. 全双工的自然感——如果你用过半双工的语音方案,再试这个,差别很明显
  3. CLI + Skills 配合 Claude Code 的效率——可以快速生成一个能跑的语音 Agent

需要注意的地方:

  1. Real-time Vision 和 Real-time Voice需要自备 OpenAI Key,选的时候注意
  2. 免费额度 300 分钟,后面就要付费了,这个量级够原型验证,但长期使用需要算一下成本
  3. 如果你是第一次接触 WebRTC,理解底层概念可能需要补一些背景知识

总的来说,如果你想给产品加一个语音 AI 交互能力,Agora 这套方案值得花一个下午亲自试一下,不用提前准备各种 API Key,最快十分钟就能跑到"出声"那一步,对于开发者来说,这个体验确实不错。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐