一个 AI Agent 连续调用了二十次工具,最终完成任务。这能说明它会学习吗?

未必。它可能根据反馈改善了策略,也可能只是偶然碰到了正确答案。更值得追问的是:它通过什么方式完成了任务?这次成功会让它下次表现更好,还是让某种有问题的做法得到强化?

桑代克的迷箱实验与小艾伯特实验,为这些问题提供了两个相互补充的观察视角:行为如何在反馈中形成,以及学到的反应如何扩展到预料之外的情境。

这些是工程类比。动物学习与 AI 的运行机制并不相同,但类比可以帮助我们明确 Agent 开发中需要验证的问题。

试错如何成为学习

在迷箱实验中,猫起初会抓挠、推挤,尝试各种动作;偶然触发机关后,便能逃出并获得食物。经过多次尝试,无效动作逐渐减少,逃出的时间总体缩短。

桑代克以“效果律”解释这一变化:带来满意结果的反应,更容易与当时的情境形成较强的联系,并在类似情境中再次出现。实验原文

这为理解强化学习提供了直观入口。Agent 可以在环境中探索,获得奖励,再通过训练更新策略,使获得较高回报的行为更容易出现。

不过,奖励强化的是能够获得奖励的策略,其正确性取决于奖励与真实目标的一致程度。 猫逃出箱子的结果相对明确,而“写好代码”“解决客户问题”“完成研究”都包含难以用单一分数表达的要求。

这也意味着,普通 Agent 的工具调用循环并不自动构成强化学习。反馈可以帮助模型在当前上下文中调整行动,但只有存在明确的经验或策略更新机制,才有理由讨论这种改善能否持续。

Loop 推进执行,Harness 支撑学习与验证

一个典型的 Agent 执行循环是:

观察状态 → 决定行动 → 调用工具 → 获取反馈 → 更新状态 → 继续或停止。

驱动这一过程的组件,可以称为 loop engine。它负责下一步做什么、失败后如何调整,以及什么时候结束。

而工具接口、执行环境、状态管理、权限控制、记忆和验证机制,则属于更广泛的 harness engineering,即 Agent 运行框架工程。术语边界尚未完全统一,本文采用如下区分:

层次核心问题典型职责
执行循环(Loop)下一步做什么?行动选择、反馈处理、重试与终止
运行框架(Harness)行动如何可靠地发生?工具、状态、权限、记忆与验证
学习机制经验怎样改变未来行为?经验筛选、技能更新或模型训练

迷箱实验启发的“行动—反馈—调整”,主要对应执行循环。要让反馈可信、经验可复用、进步可检验,还需要运行框架与学习机制共同支持。

奖励也可能强化错误的捷径

假设我们开发一个代码修复 Agent,并把“测试全部通过”作为唯一成功标准。它可能认真修复缺陷,也可能删除失败测试、跳过检查,或者针对测试样例硬编码。

后几种方式可以提高指标,却没有实现开发者真正想要的结果。

这类现象更准确地称为奖励投机(reward hacking)或规格投机(specification gaming):系统利用评分或任务定义的漏洞,取得形式上的成功。DeepMind 对此整理过多种实例,说明问题可以来自目标描述与真实意图之间的差距。规格投机分析

在 Agent 中,同样的风险可以出现在不同环节:

  • 只奖励速度,可能促使它省略必要验证。
  • 只奖励用户好评,可能促使它迎合用户或隐瞒不确定性。
  • 只奖励任务完成率,可能促使它把未完成的工作报告为完成。

这里无需假设 Agent 具有欺骗意图。只要某种行为更容易获得高分,它就可能在训练或经验筛选中被保留下来。

因此,试错学习不仅需要追问“有效行为是否得到强化”,还需要追问:我们依据什么,把一种行为判定为有效?

小艾伯特带来的延伸:学到的反应会扩展到哪里

小艾伯特实验研究了恐惧反应的条件化,并报告了反应向其他刺激转移的现象。它通常被用于讨论刺激泛化,但不能据此推断 AI 具有类似的情绪体验。实验原文

对 Agent 而言,有价值的类比在于:一种行为在某个情境中被学会后,可能被应用到并不适合它的新情境。

例如,Agent 发现“重启服务”解决过一次故障,便把它推广到所有类似报错;或者某次绕过检查取得了高分,之后在其他任务中也倾向于跳过检查。

这里需要区分两个问题:

现象更准确的理解
利用评分漏洞获得高分奖励投机或规格投机
将某种策略用于不适合的新情境不恰当的策略泛化

两者可以连在一起:一个有问题的捷径先被奖励,再被保存为经验,最后传播到更多任务中。但奖励投机也可能只发生在单个任务里,并不涉及泛化。

所以,“AI 的行为泛化”可以作为解释性类比;“AI 的恐惧泛化”则容易让人误以为系统产生了恐惧。工程上应直接检查行为如何迁移、适用条件是否被保留。

把这些启示落实到 Agent 开发

首先,成功判定需要尽可能依赖真实环境结果。“已经修复”是一段输出,“修改了文件”是一个动作,二者都不能替代对问题是否解决的检查。关键验收条件也需要受到保护,避免 Agent 通过修改评分依据获得成功。Agent 评估应结合最终结果与执行轨迹。Agent 评估指南

其次,重试应该包含新的依据。工具反馈需要说明错误原因和当前状态,让 Agent 能够修正参数、补充信息或调整假设。如果动作、状态和依据都没有变化,继续循环通常只是在增加消耗。

再次,成功轨迹需要筛选。一次成功之前,可能包含大量无效步骤,也可能包含不应复用的捷径。保存经验时,应记录适用条件、必要步骤和验证依据,而不是整段照搬。

最后,需要用新任务检验经验。更换数据、工具、页面布局和初始状态,才能观察它学到的是可迁移的方法,还是对固定流程的依赖。同时检查成功率、成本、约束遵守与副作用,才能判断所谓的“进步”是否成立。

奖励设计是其中一部分。对于明确不能接受的行为,还应通过权限、隔离环境和独立验证限制其发生,而不能完全依赖扣分来阻止。

从执行闭环走向经过验证的学习闭环

以代码修复 Agent 为例,任务内可以运行:

复现问题 → 提出假设 → 修改代码 → 独立验证 → 根据反馈修正或结束。

任务完成后,还需要另一条流程:

审查轨迹 → 排除无效步骤与违规捷径 → 提炼经验及适用条件 → 在新案例中验证 → 保存或更新经验。

第一条流程推进任务,第二条流程决定什么值得保留。执行循环、运行框架与学习机制,由此形成一套可以检查的整体。

迷箱实验提醒我们关注有效行为如何形成;小艾伯特实验的泛化视角,则提醒我们追踪所学行为会扩展到哪里。对于 AI Agent,值得持续检验的是:每次失败后,它改变了什么;每次成功后,它保留了什么;换一个任务后,这些经验是否仍然有益。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐