本文基于 OpenAI 官方 RSI 博客披露的工程数据,以OpenAI RSI 架构四层模型:执行层/验证层/协调层/安全层为框架展开分析。

为什么 OpenAI 让 Agent 代替人工作后,效率比只有 3.1:1 ,而不是 10:1 甚至 100:1 ?

答案不在执行层,而在验证层。 2026 年 9 月 6 日, OpenAI 发布博客披露了这个数字——每 1 个人类验证日对应 3.1 个 AI Agent 工作日产出, Agent 使用规模在 8 个月内增长了 124 倍。这个数字说明什么? Agent 真的能替代人了?真正的问题不是"能不能",而是"卡在哪儿"。

OpenAI 把这个里程碑称为"自动化实习生"( Automated Research Intern )目标的达成。用他们自己的话说:"我们已达到去年秋季宣布的 2026 年 9 月目标——拥有一个在人类指导下完成明确验证任务的自动化系统。"

但 3.1:1 这个数字背后,真正值得深究的不是效率提升本身,而是支撑这个效率的技术架构——尤其是记忆系统

本文基于 OpenAI 官方 RSI 博客披露的工程数据,以OpenAI RSI 架构四层模型:执行层/验证层/协调层/安全层为框架展开分析。

读完本文,你将能判断 RSI 在哪些环节已落地、哪些环节仍是瓶颈,以及如何评估自身团队的准备度

RSI 的四层架构:从执行到验证

理解 OpenAI RSI 进展的关键,在于拆解它的技术架构。

2026 年 7 月,一篇收录了 1,250 篇 arXiv 论文的综述《 Recursive Self-Improvement in AI 》给出了一个清晰的框架。论文的核心论点是:自改进循环的强度,由验证器的强度决定

将 OpenAI 的实践与框架对照,可以提炼出 RSI 系统的四层架构。

第一层:执行层

上下文管理

这是 Agent 直接产生输出的环节——写代码、跑实验、读论文、生成假设。 OpenAI 数据显示,这一层的渗透率最高: Agent 在 Build 和 Run 阶段贡献了大部分 token 产出。

执行层的核心挑战是上下文窗口管理。研发 Agent 的上下文窗口通常在 100K-200K token ,但研发任务的复杂度远超单次对话能覆盖的范围。一次迭代就可能消耗 50K-80K token , 10-20 次迭代下来,上下文成本轻松超过 1M 。

OpenAI 的解法是分层上下文工程:全局上下文(项目规范、长期记忆)持久化存储,临时上下文(当前任务状态)按需加载。这在 LangChain 《 Context Engineering 》中被称为 Write/Select/Compress/Isolate 四策略

class ContextManager:
    """分层上下文:全局持久 + 临时按任务加载"""

    def __init__(self, global_ctx_path: str):
        self.global_ctx = self._load_persistent(global_ctx_path)
        self.temp_ctx: dict = {}

    def _load_persistent(self, path: str) -> dict:
        return load_json(path)

    def begin_task(self, task_id: str):
        self.temp_ctx = {
            "task_id": task_id,
            "recent_iterations": [],
            "active_tools": [],
        }

    def commit(self, result: dict):
        self.global_ctx["experiment_history"].append(result.summary)
        self.save(self.global_ctx)
        self.temp_ctx.clear()

    为什么不用单一大上下文? 共享状态会让所有 Agent 互相污染——Agent A 的中间结果会混入 Agent B 的上下文。 checkpoint 机制(每次任务开始/结束持久化状态)提供了明确的边界,代价是多一次 I/O ,但在多 Agent 场景下这是必要隔离。

    第二层:验证层

    验证器强度金字塔

    这是 RSI 的瓶颈所在。 综述提出的验证层次模型:形式化验证器 > 测试套件 > 人类评审 > 自我评估。实际自改进强度与验证器强度正相关。

    OpenAI 的 3.1:1 效率比,主要发生在有强验证器支持的领域——代码生成有 lint 和测试、实验运行有基准评测、 infra 维护有监控告警。这些都是"可验证的输出"。

    但 Decisive 和 Design 阶段——决定"做什么研发""怎么设计实验"——恰恰是最难形式化验证的。这也解释了为什么超过 50% 的成功 4-8 小时任务仍需要至少一次人工干预。不是 Agent 不够强,而是验证器不够强

    def self_eval(prompt: str, response: str) -> float:
        """最弱:模型自我评分,容易高估"""
        return model.score(prompt, response)
    
    def test_suite(passed: int, total: int) -> float:
        """中等:测试通过率,覆盖有限场景"""
        return passed / total if total else 0.0
    
    def formal_verify(spec: Spec, output: Output) -> bool:
        """最强:形式化验证,数学保证(成本最高)"""
        return verify(spec, output)  # SMT solver / theorem prover

    第三层:协调层

    当多个 Agent 协作时,协调层需要支持跨 Agent 的状态共享。

    from langgraph.checkpoint import MemorySaver
    from langgraph.graph import StateGraph
    
    app = GraphBuilder().compile(checkpointer=MemorySaver())

    checkpoint vs 直接通信:直接共享内存适合单进程内的轻量协作,但在分布式或容器化部署下, checkpoint 是唯一可靠的方式。代价是延迟增加(每次交接需要持久化+读取),但换来的是故障恢复能力和横向扩展性。

    第四层:安全层

    审计日志

    安全层的记忆是不可篡改的。所有 Agent 操作、模型调用、输出结果都被记录到审计日志中,供后续审查。 OpenAI 因安全审查暂停 Astra 模型 RL 训练,正是基于审计日志做出的决策。

    记忆系统:各层如何实现"记住"

    执行层:滚动窗口与摘要压缩

    执行层的记忆本质上是工作记忆——它需要在有限的上下文窗口内保持任务连续性。主流做法有两种:

    1.滚动窗口:保留最近 N 轮对话,超出部分丢弃。实现简单,但关键历史决策会丢失。

    2.摘要压缩:对早期对话生成摘要,保留关键信息。信息密度更高,但摘要质量依赖模型能力。

    OpenAI 的数据暗示他们采用了更精细的策略: Agent 在 Technical Help 和 Monitoring Runs 类别占比上升,说明 Agent 开始承担"记住之前发生了什么"的角色——这本质上是一种程序性记忆,即"如何做"的知识。

    验证层:结构化测试记忆

    验证层的记忆是结构化的、可查询的。测试用例、基准分数、历史结果以数据库或文件系统形式存储, Agent 可随时检索更新。这是 RSI 中最成熟的部分,因为验证记忆的本质是机器可读的自我评估

    协调层:跨 Agent 状态共享

    如前所述,MemorySaver + checkpoint 是主流方案。关键设计点在于 checkpoint 粒度——太细(每步都存)性能差,太粗(只在任务结束时存)故障恢复成本高。工程上通常采用事件追踪 + 定期快照的混合策略。

    安全层:审计日志

    所有操作写入不可变日志( append-only log ),支持事后追溯。日志本身也需要分层存储:热数据(最近 30 天)存 SSD ,冷数据归档到对象存储。

    架构决策:为什么这样设计

    RSI 四层架构模型

    决策一:分层上下文 vs 统一上下文

    方案

    优势

    劣势

    适用场景

    统一大上下文

    实现简单,检索直观

    Token 成本高,容易溢出

    单 Agent 、短任务

    分层上下文

    Token 可控,模块边界清晰

    设计复杂,需要额外的 Select/Compress 逻辑

    多 Agent 、长周期任务

    OpenAI 选择分层,是因为他们的研发任务平均周期以天计,且同时运行多个 Agent 。统一上下文在这种规模下不可行。

    决策二: Checkpoint 持久化 vs 共享内存

    方案

    优势

    劣势

    共享内存

    零延迟,代码简洁

    单点故障,无法横向扩展

    Checkpoint

    容错、可扩展、状态可追溯

    I/O 开销,设计复杂度上升

    当 Agent 数量超过 4 个( OpenAI 观察到这是常见配置)时, checkpoint 成为必要条件。

    决策三:验证器强度与成本权衡

    形式化验证效果最好,但实现成本极高——需要为每个输出定义精确的 spec ,且 SMT solver 的求解时间不可控。工程实践中,测试套件 + 人类评审的组合在成本和效果之间取得了最佳平衡,这也是 OpenAI 当前 3.1:1 效率比的真实构成。

    实战:搭建一个简化版 RSI 系统

    以下是一个最小可行实现,帮助你理解各层如何协作。代码纯 Python ,无外部依赖。

    环境准备

    import json
    import time
    import hashlib
    from dataclasses import dataclass, field
    from typing import Callable, Optional
    from pathlib import Path

    上下文管理器

    @dataclass
    class TaskContext:
        """单次任务的临时上下文"""
        task_id: str
        iterations: list[dict] = field(default_factory=list)
        tool_calls: list[dict] = field(default_factory=list)
    
    class GlobalMemory:
        """持久化全局记忆:跨任务复用"""
    
        def __init__(self, storage_path: str):
            self.path = Path(storage_path)
            self.data = self._load()
    
        def _load(self) -> dict:
            if self.path.exists():
                return json.loads(self.path.read_text())
            return {"experiments": [], "decisions": [], "knowledge_base": {}}
    
        def save(self):
            self.path.write_text(json.dumps(self.data, ensure_ascii=False, indent=2))
    
        def add_experiment(self, result: dict):
            self.data["experiments"].append(result)
            self.save()

    验证器

    class Validator:
        """多层验证器:从弱到强"""
    
        def __init__(self, tests: list[Callable], human_review: bool = False):
            self.tests = tests
            self.human_review = human_review
            self.history: list[dict] = []
    
        def validate(self, output: dict) -> dict:
            results = {"output": output, "tests": [], "passed": True}
            for i, test_fn in enumerate(self.tests):
                try:
                    passed = test_fn(output)
                    results["tests"].append({"test": i, "passed": passed})
                    if not passed:
                        results["passed"] = False
                except Exception as e:
                    results["tests"].append({"test": i, "error": str(e)})
                    results["passed"] = False
            self.history.append(results)
            return results

    执行循环

    def run_rsi_loop(
        context_mgr: GlobalMemory,
        validator: Validator,
        agent_fn: Callable[[TaskContext], dict],
        max_iterations: int = 10,
    ) -> dict:
        """RSI 核心循环:执行 -> 验证 -> 记忆"""
        ctx = TaskContext(task_id=hashlib.md5(str(time.time()).encode()).hexdigest()[:8])
    
        for i in range(max_iterations):
            output = agent_fn(ctx)
            ctx.iterations.append({"step": i, "output": output})
    
            result = validator.validate(output)
            if result["passed"]:
                context_mgr.add_experiment({
                    "task_id": ctx.task_id,
                    "iteration": i,
                    "output": output,
                    "valid": True,
                })
                return result
    
            ctx.tool_calls.append({"step": i, "feedback": "needs_revision"})
    
        return {"passed": False, "iterations": max_iterations}

    运行示例

    def test_output_format(output: dict) -> bool:
        return isinstance(output.get("result"), str) and len(output["result"]) > 10
    
    def test_consistency(output: dict) -> bool:
        return "error" not in output.lower()
    
    memory = GlobalMemory("rsi_memory.json")
    validator = Validator([test_output_format, test_consistency])
    
    def research_agent(ctx: TaskContext) -> dict:
        return {"result": f"实验结论:假设 A 在条件 C1 下成立(迭代 {len(ctx.iterations)})"}
    
    result = run_rsi_loop(memory, validator, research_agent, max_iteratinotallow=5)
    print(f"RSI 循环完成:{'通过' if result['passed'] else '未通过'}")

    这个简化版本展示了 RSI 的核心闭环:执行 → 验证 → 记忆更新 → 再执行。真实的 OpenAI 系统在验证器强度、 checkpoint 粒度和多 Agent 协调复杂度上要远超这个示例,但架构原理一致。

    三层评估框架:你的团队准备好了吗?

    三层评估框架

    回到最实用的问题: OpenAI 的 3.1:1 对我们的团队意味着什么?

    第一层:可自动化的重复性任务是否存在? 如果团队中 80% 是跑实验、写代码、看日志, Agent 可以立刻提效;如果 80% 是创造性决策, Agent 能帮的忙有限。

    第二层:验证机制是否可靠? 实验有没有自动化测试?代码变更有没有 CI/CD ?验证成果有没有可复现的基准?没有验证器, Agent 产出只是"看起来合理"。

    第三层:安全审查流程是否嵌入工作流? 输出审核、权限分级、变更追踪——这些不是障碍,而是可持续性的前提。

    三层都具备,才谈得上 RSI 实践。缺任何一层,先补齐基础设施,而非追求效率比。

    结语

    3.1:1 是里程碑,但不是终点。 OpenAI 的目标是 2028 年 3 月实现"完全自动化迭代"——还有 18 个月。

    真正值得关注的不是"AI 已经能替代多少人",而是"AI 还在哪些环节依赖人类"——规划、判断、价值权衡。这些地方,恰恰是人类不可替代的核心价值。

    当 Agent 能帮你完成 3.1 倍的工作时,你可能不需要更多"执行者"了。你可能需要的,是更清晰的"决策者",以及一套能支撑决策的记忆系统。

    最后

    我们整理出这套 AI 大模型 突围资料包:

        ✅ 从零到一的 AI 学习路径图
        ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
        ✅ 百度/阿里专家闭门录播课
        ✅ 大模型当下最新行业报告
        ✅ 真实大厂面试真题
        ✅ 2025 最新岗位需求图谱

    所有资料 ⚡️ ,朋友们如果有需要 《 AI大模型 入门+进阶学习资源包》,下方扫码获取~

    资料展示

    下面是我整理的AI大模型学习资料和工具包预览,适合收藏后按主题逐步学习。

    需要这份AI大模型资料清单的话,在评论区回复「清单」即可;我会根据大家的问题继续补充对应的实战内容。

    Logo

    Agent 垂直技术社区,欢迎活跃、内容共建。

    更多推荐