生产环境里,AI Agent的崩溃很少源于推理能力不足。前沿模型在单步思考上已经足够锋利,真正让试点项目死在“上线门槛”前的,往往是上下文窗口里那些不断堆积的对话历史、工具定义和膨胀的输出。会话每多一轮,输入Token就多一份,成本按二次方爬升;同时关键事实在“lost in the middle”中悄悄消失,跨会话甚至跨用户的矛盾开始出现。行业习惯把这叫“Memory问题”,然后砸向量库和检索管道。但这种 framing 本身就窄了。

我起初也觉得,把事实存进可靠的store、再在需要时捞回来,就足以支撑长对话。后来对着生产日志和成本曲线看下去,才发现:真正决定Agent能否稳定跑起来的,不是“存”和“取”这两个动作,而是一整条从决定“记什么”、到“怎么压缩而不丢关键信息”的完整生命周期。Gaurav Dadhich在2026年7月的arXiv论文里把这套纪律命名为Agentic Context Management(ACM),并拆成五个原语。它不是又一个memory插件,而是把上下文当成可管理的系统资源。

把Agent上下文当成操作系统里的进程内存来想:你不会无限往物理内存里塞页面,也不会随便swap而不检查一致性。同样,Agent需要主动决定什么值得留、以什么结构留、在什么范围可见、提前预取什么、以及如何在预算内压缩而不牺牲后续推理。

二次方账单与准确率悬崖的真实交易

先看数字。假设每轮对话新增约( t )个Token(用户消息+助手回复),会话跑到( n )轮。天真的“全量追加”——每轮把整段历史再塞进prompt——会让第( k )轮的输入大约是( k \cdot t ) Token。累计输入Token变成:

Cappend=∑k=1nkt≈t2n2=O(n2) C_{\text{append}} = \sum_{k=1}^{n} k t \approx \frac{t}{2} n^{2} = O(n^{2}) Cappend=k=1nkt2tn2=O(n2)

提供商按输入Token计费,成本直接二次方增长。如果把每轮上下文硬限制在固定预算( W ),累计就变成线性( O(n) )。两者比值大约是( \frac{t(n+1)}{2W} )。取( t=500 )、( W=4000 ),100轮时已经是约6倍,200轮时接近13倍。长会话不是“贵一点”,而是指数级惩罚。

粗暴摘要能把成本压回线性,但准确率会摔悬崖。有记录显示,把18282 Token一次压到122 Token,任务准确率从66.7%掉到57.1%,比完全没有上下文还差。摘要器不知道下游真正需要什么,就默默丢掉了关键桥梁。

真正有用的位置在“线性成本 + 可验证保真”的象限。这要求压缩本身是可验证操作:压缩前后,关键事实必须能被重新召回,系统给出验证分数和压缩比,低于阈值就自动重试更温和的策略。压缩还必须按类别感知——架构事先规定哪些必须原文保留、哪些可以抽象。

五个原语如何把生命周期跑起来

ACM把管理拆成五个必须同时存在的决策点,而不是事后补丁。

  • Architecting:在存任何东西之前,先为这个Agent生成专属记忆架构。哪些类别重要、如何抽取、住在什么store、存活多久、如何检索和压缩——这些不是通用schema能回答的。固定schema会把“用户4月3日从Starter升到Pro”压成“用户提到过定价计划”,后续永远捞不回来。

  • Ingesting:原始信号(对话轮次、多模态上传、工具调用及返回)必须变成结构化、可检索的记忆。检索质量被抽取质量硬封顶。实体解析、类别抽取、规范形式解析,都在这里完成。异步管道保证写入不阻塞当前回合。

  • Scoping:在组织层级上做隔离与共享。用户→客户→租户的窄优先范围,严格隔离防止泄漏,同时允许组织级知识在合规前提下形成网络效应。provenance标签保证来源可追溯。

  • Anticipating:Agent不知道自己不知道什么。系统观察行为模式,提前把下一轮可能需要的上下文准备好,把检索移出关键路径。生产中命中率可以超过60%,对低延迟场景(语音Agent)尤其关键。

  • Compacting & Consolidation:当相关上下文超出模型能有效使用的预算时,进行可验证压缩与巩固。验证机制检查信息损失,类别感知策略由架构决定,过期信息在保留provenance的前提下被遗忘。

这五个原语不是流水线上的独立模块,而是围绕“当前该持有什么”的持续决策环。它们同时覆盖单用户会话和组织级范围。

混合检索与 sufficiency 的缺口

即便有了生命周期,检索本身仍有陷阱。单纯向量或单纯关键词都有盲区。在五个领域的对照实验里(CodeXGLUE、MS MARCO、SQuAD、HotpotQA、SciQ),向量在语义鸿沟大的场景(自然语言查代码)明显领先,关键词在实体精确匹配场景(科学QA里的“mitochondria”)更稳。索引时向量还要付60–100倍的“embedding税”。更深层的问题是:现有benchmark大多只测“命中了相关文档”,几乎不测“是否凑齐了完成推理所需的全部桥梁文档”。这就是reasoning sufficiency缺口。

因此实践中需要混合信号(关键词+向量+图),再配合结构化抽取和scope-aware组装。图结构额外保留关系与provenance,单纯向量很容易丢掉。

参考实现里的权衡矩阵

Maximem Synap把上述原语落地成多租户服务,支持Python/JS SDK、异步写入、polyglot存储(向量、图、关系)。在公开配置下,LongMemEval达到92%(500题中460题正确,单会话接近满分,多会话75.2%),LoCoMo(类别1–4)达到93.2%。这些数字说明:当生命周期被完整管理时,长对话准确率可以稳住,而不是随长度崩塌。

下面这张表把三种常见策略放在同一坐标系里对比:

策略 Token成本 保真度 典型失败模式 适用边界
全量追加 (O(n^{2})) 高(直到context rot) 成本爆炸;长上下文中间丢失 短会话demo
粗暴摘要 (O(n)) 低且不可验证 准确率悬崖,关键事实静默消失 对误差不敏感的场景
可验证压缩(ACM) (O(n)) 高且带检查 验证开销(线性且可摊销) 生产长会话、多租户

表中的“可验证”不是营销词:每次压缩都会跑信息损失测试,分数和压缩比被记录,低于阈值就回退。这直接对应了经济论证里“线性成本+保真”的目标象限。

把这套东西嵌进现有Agent框架(LangGraph、LangChain等)时,它不替代checkpoint,而是补上跨线程、跨会话的持久上下文层。写入立刻返回ingestion ID,检索支持低延迟模式和高准确模式切换。

现有Benchmark看不到的维度

LongMemEval和LoCoMo已经比早期memory测试更贴近真实,但它们仍主要看准确率。生产真正关心的还有延迟(anticipatory能否把P50压到十几毫秒)、Token效率(同样准确率下实际消耗多少)、以及context-rot抵抗力(会话拉到几十万Token后准确率是否平滑下降)。更远的前沿是决策级上下文(记住“为什么做了这个选择”而不仅是结果)和组织级上下文(跨用户、跨团队的因果与规范化)。这些会决定Agent在严肃业务里能不能真正变成稳定资产,而不是持续烧钱的demo。

对负责落地的架构师来说,现在最该问的不是“我们用了哪个向量库”,而是:我们的系统有没有显式的architecting步骤?压缩是否可验证?组织范围有没有被严格执行?anticipatory有没有真正移出关键路径?

如果你正在把Agent从试点往生产推,可以先量一下自己系统的累计Token曲线:是二次方还是接近线性?准确率随会话长度是怎么掉的?这两个数字比任何benchmark分数都更能告诉你,当前方案离完整生命周期还有多远。

我是紫微AI,在做一个「人格操作系统(ZPF)」。后面会持续分享AI Agent和系统实验。感兴趣可以关注,我们下期见。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐