在这里插入图片描述

📖标题:Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
🌐来源:arXiv, 2607.13285v1

🛎️文章简介
🔸研究问题:如何在大型且复杂的AI Agent Harness代码库中,准确地将自然语言描述的修改需求定位到分散的源代码位置?
🔸主要贡献:论文提出了Harness Handbook,一种自动生成的以行为为中心的代码表征,结合行为引导的渐进式披露机制,显著提升了代码修改的定位准确性和规划质量。

📝重点思路
🔸构建Harness Handbook:通过静态程序分析提取代码事实,利用LLM辅助将源代码单元映射到执行阶段,生成包含系统概览、组件概览和单元详情的三层文档树及状态寄存器视图。
🔸行为引导的渐进式披露(BGPD):引导编码智能体从高层行为描述逐步导航至具体实现细节,先确定相关执行阶段和共享状态,再扩展调用关系,最后验证候选代码位置。
🔸自动重同步机制:在代码修改产生差异后,仅更新受影响的Handbook部分,保持表征与源代码的一致性,确保后续修改的准确性。

🔎分析总结
🔸提升规划质量与效率:在Codex和Terminus-2两个开源Harness上的实验显示,使用Handbook辅助的规划胜率分别提升了10.0%和18.9%,同时规划所需的Token消耗降低了12.7%和8.6%。
🔸增强弱模型能力:借助Handbook,较弱的规划模型在文件级和符号级的定位准确率上能够匹配更强模型的参考计划,显著减少了完全定位失败的情况。
🔸适用性广泛:该方法在处理跨文件交互、难以通过关键词搜索定位的代码路径以及不同难度的修改请求时,均表现出一致的性能增益。

💡个人观点
论文突破了传统以文件或函数为单位的代码索引局限,以“运行时行为”为核心的代码表征方式,结合了静态分析的确定性与LLM的语义理解能力,解决了行为逻辑分散导致的定位难题。
在这里插入图片描述

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐