很多人第一次接触“声音 + AI”时,都会产生一个很直接的设想:既然语速、停顿、音高和说话方式都能被识别,Voice Agent 是否可以据此判断用户的 MBTI,再自动切换话术?

我不建议这样做。

问题不在于“模型还不够准”,而在于这个目标本身就偏了。一次电话里的快语速,可能来自着急办理业务、线路延迟、方言表达习惯,也可能只是用户当时心情不好。把这些短时信号直接翻译成稳定人格标签,既缺少可靠的验证路径,也会让客服系统越过不该越过的边界。

闪电智能 Voice Agent 更适合解决另一个、更具体的问题:系统能否结合语音韵律、对话行为和业务上下文,初步推测用户当前更接受哪种沟通方式,并在用户明确反对时立即改回来?

这里的输出不该是“用户是 ENTJ”或“用户偏向某类人格”。它应该是:

当前证据下,系统更适合用简洁推进、清晰确认、关怀承接还是探索引导的方式继续对话;这个判断有多大把握;用户是否已经给出了相反意见。

这就是 VASI,Voice Adaptive Service Interaction,声音沟通策略自适应,想建立的工程框架。

目录

  1. 先把 MBTI 放回正确的位置
  2. VASI 的输出:策略,而不是人格
  3. 这条链路到底在处理什么
  4. 能参考的信号,和不该越界的信号
  5. 三道闸门:别让推测跑在用户前面
  6. 怎样验证它真的有用
  7. 隐私与日志:记录策略依据,不记录人格标签

先把 MBTI 放回正确的位置

MBTI 可以作为讨论表达倾向的传播入口,但不应成为客服系统的判定结果。

如果一个系统把“语速快”写成“高执行型人格”,再据此缩短回答、跳过确认,问题很快会暴露出来:用户也许只是赶时间,却仍希望对金额、地址或售后规则得到明确说明。系统以为自己在“懂用户”,实际上是在替用户做未经允许的判断。

Voice Agent 在客服场景中不需要回答“你是什么样的人”。它需要回答的是:用户现在是否希望少解释、快推进;对方是否在反复确认,说明当前信息不够清楚;这通电话是普通咨询,还是投诉升级、敏感问题、多轮失败;系统能否继续自动处理,还是应该给出转人工入口。

这两个问题看起来接近,工程上却完全不同。前者是标签化推断,后者是面向当前任务的策略选择。

VASI 的输出:策略,而不是人格

VASI 首先定义四类可切换的服务策略。它们不是用户身份,也不需要长期绑定到某个客户档案。

服务策略 适合的当前信号 对话上的变化
高效推进 用户明确要求直接说明、持续催办、回答短促 缩短铺垫,优先给操作路径和结论
清晰确认 关键字段多、用户多次追问、ASR 可能误识别 提高确认频率,复述金额、地址、时间等关键信息
关怀承接 投诉、明显挫败、连续失败、重复解释 先确认问题和情绪,再说明下一步处理动作
探索引导 用户在比较方案、理解规则、表达犹豫 增加解释深度,按选项逐步帮助决策

同一个用户在不同场景下可能需要完全不同的策略。办理宽带报修时,他可能只想听到“什么时候上门”;咨询复杂套餐时,又需要更多解释。把策略做成动态状态,而不是静态画像,系统才有机会纠正自己。

这条链路到底在处理什么

VASI 不应把原始音频直接送进一个“人格分类器”。更稳妥的链路是先拆开可观察信号、推测结果与实际动作。

实时语音与对话

可观察特征

沟通偏好概率

置信度与风险校验

服务策略编排

回答与转人工动作

用户反馈和策略修正

第一层处理的是事实:语速变化、长停顿、重叠说话、追问次数、用户是否明确说过“别绕弯子”、当前处于什么业务节点。

第二层才是推测。系统可以给出“更偏好简洁推进,置信度 0.62”这样的内部状态,但不能把它包装成对人格的确定结论。

最后一层才是对话动作:减少铺垫、多做字段确认、补充解释,或者在高风险场景下直接给出人工入口。

对闪电智能 Voice Agent 来说,这条分层很重要。ASR、VAD、TTS、LLM 和 CRM 都会参与其中,但没有任何一个模块应该单独决定“用户是什么样的人”。

能参考的信号,和不该越界的信号

能进入策略引擎的,应该是与当前沟通任务直接相关、可解释、可被用户纠正的信号。

例如,用户在本通电话中明确提出“直接告诉我怎么做”“你说慢一点”;用户连续追问同一个字段,说明现有解释没有被理解;用户多次打断,可能希望缩短铺垫,也可能是系统说得太慢;当前任务涉及退款、投诉、地址、金额或身份核验,需要更高确认密度;ASR 对关键字段置信度不足,系统不应假装听懂。

不该直接用于自动决策的,是把音高、口音、性别、地域或某一时刻的情绪表达,推断为稳定人格、能力或敏感身份。电话窄带、噪声、设备差异和方言都会污染音频特征;ASR 的错字也会把“用户很急”误判成“用户很不耐烦”。

因此,特征记录最好保留“发生了什么”,而不是保存“这个人属于什么类型”。记录“近三轮存在两次明确催办”和“地址字段需要二次确认”是可审计的;记录“用户偏外向型人格”则既模糊又难以纠正。

三道闸门:别让推测跑在用户前面

策略自适应系统至少要有三道闸门。

第一道是用户显式偏好优先。用户说“不要解释太多”“你一步一步说”,这类表达比任何模型推测都更可靠。系统应立刻改写策略,并把这次调整的来源记为 explicit_preference,而不是继续沿用音频推测。

第二道是低置信度回退。没有足够证据时,系统应使用中性默认策略。宁可多问一句“需要我简要说明,还是按步骤带您操作”,也不要强行压缩回答或过度共情。

第三道是高风险场景人工兜底。投诉升级、敏感事项、多轮失败、身份核验、金额争议等场景,策略引擎只能辅助对话,不能绕开既有业务规则。此时要优先保证转人工、上下文摘要和关键证据完整,而不是继续优化“话术匹配”。

下面的代码只表达决策优先级,不代表线上阈值配置:

def choose_service_strategy(signals, business_state):
    if signals.explicit_preference:
        return {
            "strategy": signals.explicit_preference,
            "source": "explicit_preference",
            "reversible": True,
        }

    if business_state.is_high_risk:
        return {
            "strategy": "neutral_confirm",
            "source": "risk_fallback",
            "offer_human_handoff": True,
        }

    if signals.preference_confidence < 0.75:
        return {
            "strategy": "neutral_default",
            "source": "low_confidence_fallback",
        }

    return {
        "strategy": signals.proposed_strategy,
        "source": "probabilistic_inference",
        "reversible": True,
    }

这里的 0.75 只是示意。真实阈值不能拍脑袋设定,它需要依据业务风险、样本质量和用户纠正率逐步校准。更重要的是,所有策略都应当可撤销。

怎样验证它真的有用

VASI 不能用“人格识别准确率”证明自己有效,因为系统本来就不应该把人格分类当目标。

真正值得测的是策略有没有改善当下的服务体验:用户主动纠正系统沟通方式的比例;任务完成率与平均对话轮次;同一问题被重复解释的次数;转人工率、投诉率与失败后的恢复情况;不同电话环境、方言和业务场景下的稳定性;用户对“是否听明白、是否说得合适”的主观评价。

测试时还要避免一个常见错误:同时换模型、换 VAD 阈值、换话术,再宣布“满意度变好了”。这样无法知道变化到底来自哪里。

更可靠的做法是先固定场景和基础话术,只改一个策略变量。例如,在“用户明确催办”的样本中,只调整回答长度与确认频率;在“地址字段确认”的样本中,只调整复述规则。没有真实样本、对照组和风险指标,就不能把 Demo 里的顺滑体验写成生产效果。

隐私与日志:记录策略依据,不记录人格标签

声音、声纹及其衍生推断涉及较高的隐私与治理要求。我国《个人信息保护法》将生物识别信息列为敏感个人信息;具体到音频、声纹和推断结果的处理边界,应结合实际数据流、用途和业务场景由合规团队评估,而不是在产品文案里一笔带过。《中华人民共和国个人信息保护法》

从工程实现看,VASI 的日志应尽量记录:

{
  "turn_id": "call_018_turn_07",
  "observed_signals": [
    "explicit_request_for_brief_answer",
    "repeated_question_about_refund_time"
  ],
  "selected_strategy": "efficient_progression",
  "confidence": 0.82,
  "decision_source": "explicit_preference",
  "user_corrected": false,
  "human_handoff_offered": false
}

不要把“MBTI 类型”“性格标签”这类字段写入 CRM,也不要让下游系统把策略推测用于与客服任务无关的自动决策。NIST 的 AI 风险管理框架也强调,风险管理不应只停在模型上线前,而需要覆盖设计、部署和持续监测。NIST AI RMF 1.0

结语

VASI 的第一步不是训练一个更会“看人”的模型,而是限制系统可以做什么。

它可以根据当前语音、对话和业务状态,选择更合适的沟通方式;它必须承认不确定性;用户一旦明确表达偏好,系统就要让位。高风险场景里,它更应该把问题交给人工,而不是证明自己有多聪明。

最终,系统输出不该是“这个用户是什么类型”,而应是:

在当前证据和风险边界下,我为什么选择这样说话;如果你不喜欢,我可以立刻换一种方式。

参考资料

  1. 中华人民共和国个人信息保护法
  2. NIST Artificial Intelligence Risk Management Framework 1.0
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐