AI Agent在选择工具API时,目前存在两种主流方向:自主选择工具API和由开发者提供固定API。

自主选择工具API的优势有两点:第一点是灵活性与适应性。AI Agent可根据任务动态选择最适合的工具,应对复杂多变的任务场景。因为在AI agent完成任务与环境交互的过程中可能会出现我们无法事先完全预测的情况,这可能导致固定的工具API面对这种变化不再有效。第二点是创新能力:让AI agent根据任务的反馈自主探索工具组合,可能发现新的解决方案或优化路径,这尤其在开放性、无明确规则的任务中表现突出,如创意设计、科研探索等领域。而固定的工具选择就可能成为约束。但同时,自主选择也有一些潜在的问题,比如准确性与稳定性。当前AI模型的规划能力有限,可能因幻觉或错误推理选择不合适的工具,导致结果不准确或任务失败。这也是很多AI agent在完成任务时遇到的问题,经常因为工具调用的失败和错误而导致整个任务无法继续进行。而开发者提供固定API的优势首先在于可靠性与稳定性:通过预定义工具链和流程,确保Agent在特定场景下按既定规则执行,减少错误和不确定性。但问题就是灵活性受限,难以适应新场景或任务变化。未来,可能混合模式会成为主流,也就是结合两者优势,根据任务类型和场景动态切换模式。例如,在开放性探索任务中允许Agent自主选择工具,而在关键业务流程中采用固定工具链确保稳定性。

所以从上面的分析来看,我们还是学会给AI agent提供工具并进行给出必要的使用教程(当然,在给AI Agent提供工具时,是否需要提供教程取决于具体场景和工具的复杂程度。)教程中提到,一个良好定义的工具应包含以下三个核心要素:第一个是 名称 : 一个简洁、唯一的标识符,供智能体在 `Action` 中调用,例如 `Search`。第二个是 描述 : 一段清晰的自然语言描述,说明这个工具的用途。这是整个机制中最关键的部分,因为大语言模型会依赖这段描述来判断何时使用哪个工具。第三个是 执行逻辑 : 真正执行任务的函数或方法。这其实也体现了我们在构建AI agent中很需要注意的的一点,就是结构化的信息和指令,这种结构化输出有助于模型更好地理解和处理复杂任务。其实我们从大模型的输出结果也可以看出,大模型的输出内容往往是条理清晰,有清晰的结构特征,也有一些深层的原因,例如将信息组织成条目便于数据处理和存储。AI系统可以更高效地生成、检索和管理分条信息,同时也有利于后续的优化和迭代等等。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐