0-1 全自研:AI 外呼机器人系统架构设计与延迟优化实践

在 2026 年,随着 LLM(大模型)能力的爆发,传统的基于 IVR(交互式语音应答)模板的电销系统已进入淘汰周期。然而,直接接入 AI Agent 进行外呼面临严重的工程化挑战,尤其是端到端延迟(Latency)话术确定性(Business Logic Determinism)。本文将分享我们基于“大模型意图识别 + 受控状态机”架构的“方途智呼”系统设计经验。

一、 系统架构选型:为什么是“混合驱动”?

纯 Agent 驱动方案虽然灵活,但在商业电销场景中表现往往不尽如人意。通过对比,我们选择了“方途智呼”的混合驱动架构:

关键技术指标 纯 Agent 方案 方途智呼(混合架构)
打断灵敏度 差 (>1500ms) 优 (~800ms)
逻辑合规性 低(易幻觉) 高(状态机约束)
系统鲁棒性 中(受限于大模型) 高(业务流程可控)

二、 核心技术模块解析

1. 毫秒级前端 VAD(语音活动检测)

为了实现类似真人的平滑打断,我们放弃了通用 VAD 库,通过轻量级自研模型在前端进行实时静音检测。当用户在机器人播放过程中插入语音时,系统在 300ms 内触发打断信号,释放 TTS 线程,大幅降低了对话的“撞车感”。

2. 意图解析的双轨并行设计

系统采用“双轨并行”模式处理用户输入:

  • 链路 A(NLP 解析): 利用大模型进行语义理解,捕捉用户复杂的意图碎片(如:拒绝原因、犹豫情绪、特定需求)。
  • 链路 B(关键词/语义匹配): 用于快速捕捉核心业务节点(如“要价格”、“加微信”),直接触发对应的状态机转移。

3. 状态机强制拦截(Safety Net)

这是保证业务合规的核心。大模型生成的文本作为“意图描述”,通过 状态机(State Machine) 转换为标准的话术输出。如果大模型的输出偏离了预设的业务逻辑路径,状态机会强制将对话回滚到合规节点。

三、 关键代码实现思路(Python 伪代码)

在实际工程中,我们通过状态机引擎管理对话流程,代码逻辑如下:

class OutboundStateMachine:
    def __init__(self):
        self.state = "START"

    def transition(self, intent):
        # 通过大模型识别意图,结合状态机强制约束
        if self.state == "ASK_PRICE" and intent == "REFUSE":
            self.state = "END"
            return "明白,打扰了。"
        # ... 其他业务逻辑

四、 总结与展望

“方途智呼”混合架构的优势在于将 LLM 的推理能力与传统状态机的流程控制能力进行了深度融合。在后续的优化中,我们将尝试引入 KV Cache 预加载技术,进一步将端到端延迟压至 500ms 以内,以支撑更复杂的高频线索清洗业务。

本文基于团队方途智呼(FangTu-SmartCall)自研项目架构整理,希望能为正在做 AI 外呼开发的工程师提供参考。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐