英伟达AI刷爆ARC-AGI-3!AVO Harness架构让Agent从30%飙升到100%

关键词:NVIDIA AVO、ARC-AGI-3、Agent Harness、持久化记忆、分层监督、自主推理


目录


一、导语:为什么这条消息值得关注

2026年8月21日,NVIDIA官方博客发布重磅消息:其研发的 AVO (Agentic Variation Operators) 系统在 ARC-AGI-3 基准测试中达到 100% RHAE 分数,成功通关全部 183 个关卡,跨越 25 个陌生环境——而作为基础模型的 Claude Opus 5 单独测试时仅得 30.2%

这个结果的震撼之处在于:差距并不来自换了更大的模型,而是来自模型之外的系统架构设计。AVO 通过引入持久化记忆、分层监督、迭代循环等机制,将同一模型的推理能力放大了 3倍以上。对于正在构建 AI Agent 的开发者来说,这意味着"模型能力不是天花板,Harness 设计才是";对于企业用户,这提示我们在选择 Agent 方案时应该更关注系统工程而非单纯追求参数规模;对于研究者,AVO 为"如何让 LLM 在长周期任务中保持高效推理"提供了一个可复现的工程范式。

二、ARC-AGI-3到底是什么?最严苛的AGI测试

2.1 不是什么

ARC-AGI-3 不是:

  • 一个传统的 NLP 基准测试(如 MMLU、GSM8K 那样有标准问答格式)
  • 一个图像识别任务(不依赖预训练视觉模型的知识迁移)
  • 一个有明确规则和目标说明的任务(Agent 进入环境时完全"蒙在鼓里")
  • 一个可以通过暴力搜索或穷举解决的简单谜题(状态空间指数级爆炸)

2.2 是什么

ARC-AGI-3 (Abstraction and Reasoning Corpus for AGI, Version 3) 是由 ARC Prize Foundation 于 2026年3月25日 发布的交互式推理基准测试,专门用于衡量 AI 的类人通用智能能力。

它的核心设定是:

  • Agent 被丢进一个 64×64 像素的网格游戏世界(类似简单的 2D 游戏)
  • 没有规则说明书、没有任务提示、没有目标描述
  • Agent 必须通过自主试错、观察反馈、总结规律来理解环境运作方式
  • 每个环境包含多个关卡(level),Agent 需要找到通关条件并达成
  • 测评指标是 RHAE (Relative Human Action Efficiency),即相对于人类最优解的动作效率比

公开集包含 25 个环境、183 个关卡,涵盖逻辑推理、模式识别、空间操作、因果推断等多种认知能力。

2.3 为什么这么难

ARC-AGI-3 的难度体现在三个维度:

  1. 零样本泛化要求:每个环境的规则都是全新的,无法通过训练数据覆盖
  2. 长程推理压力:部分关卡需要数十甚至上百步才能发现规律并完成目标
  3. 探索效率约束:动作次数直接影响得分,盲目试错会导致低分

这也是为什么顶级前沿模型在这个测试上的表现如此惨淡:

AI 系统 ARC-AGI-3 得分 备注
NVIDIA AVO + Claude Opus 5 100% 全部 183 关通关
Claude Opus 5 (原生) 30.2% Anthropic 当前最强模型
Claude Opus 4.8 (High) 1.5% 花费 $10,000/任务
GPT-5.4 (High) 0.26% OpenAI 前沿模型
GPT-5.5 (High) 0.4% OpenAI 更新版本
Grok-4.20 (Beta) 0.00% xAI 模型完全失败

数据来源:ARC Prize 官方 Leaderboard 及 NVIDIA 博客 (2026年8月)

在这里插入图片描述

(上图:ARC-AGI-3 性能对比图,NVIDIA AVO 以 100% 完成率碾压所有顶级大模型)

三、核心揭秘:AVO如何把30%拉到100%

3.1 AVO架构全景图

AVO (Agentic Variation Operators) 是 NVIDIA 开发的通用型 Agent 系统架构,专为长周期自主任务设计。它不是一个新的语言模型,而是一套围绕现有 LLM 构建的 Harness(套索/框架系统)

在这里插入图片描述

(上图:AVO 系统架构图,展示了主 Agent、监督器、记忆系统、工具库四大核心组件及其交互关系)

AVO 的核心组件包括:

组件 功能 技术实现
主 Agent 执行具体推理和行动 基于 Claude Opus 5,负责环境交互
监督器 (Supervisor) 监控整体进度,防止死循环 独立 Agent,可介入纠正方向
持久化记忆 跨步骤保留关键发现 结构化存储(SQLite),支持读写
工具与技能库 提供环境交互接口 任务特定的 API 封装
错误检测模块 实时监控执行偏差 反馈循环机制

3.2 持久化记忆:跨会话的"经验积累"

这是 AVO 与原生 LLM 最大的区别之一。

传统 LLM 的局限

  • 每次调用都是无状态的(stateless)
  • 上下文窗口有限,早期发现容易被遗忘
  • 无法跨关卡复用已验证的规律

AVO 的解决方案

  • 使用外部持久化存储(如 SQLite 数据库)
  • 将关键发现以结构化形式保存(环境规则、有效策略、失败教训)
  • 在后续步骤中主动检索相关记忆,避免重复探索

举个例子:如果 Agent 在第 5 关发现"红色方块碰到蓝色区域会触发传送",这个规律会被写入记忆库。当第 15 关出现类似机制时,Agent 可以直接调用该假设进行验证,而不是从头摸索。

3.3 分层监督:防止Agent"钻牛角尖"

长周期任务中,Agent 很容易陷入局部最优或死循环——反复尝试同一条错误路径而不自知。

AVO 引入了分层监督机制 (Hierarchical Supervision)

工作层级 (Worker Agent)
├── 负责具体的观察、推理、行动执行
├── 关注当前步骤的细节优化
└── 向监督器汇报进度和异常

监督层级 (Supervisor Agent)
├── 监控全局搜索轨迹
├── 检测重复模式或停滞信号
├── 在必要时强制调整策略(如"换个思路试试X方向")
└── 管理资源预算(总步数上限、时间限制)

这种设计类似于公司里的"员工+经理"关系:员工专注执行,经理把控方向。在 ARC-AGI-3 测试中,监督器帮助 AVO 避免了大量无效探索,使得总动作数比之前的 VISTA 系统少了 12%(6,624 vs 7,542)。

3.4 迭代循环:检查→规划→执行→评估

AVO 的核心工作流程是一个闭环迭代过程:

在这里插入图片描述

(上图:AVO 从零开始到完成任务的完整工作循环)

每个循环包含四个阶段:

  1. 环境观察 (Inspect):获取当前帧的状态信息
  2. 规划决策 (Plan):基于历史记忆和当前状态形成假设
  3. 行动实施 (Implement):执行选定的动作
  4. 结果评估 (Evaluate):分析反馈,更新记忆库

关键点在于:每次循环都会更新记忆和策略,而不是简单地重试。这使得 Agent 具备真正的"学习能力",而非随机搜索。

3.5 与原生模型的性能对比

为了量化 AVO 各组件的贡献度,我们从技术维度进行了拆解:

在这里插入图片描述

(上图:左图为 AVO vs 原生 LLM 在五项关键能力上的对比;右图为各组件的重要性评分)

核心洞察

  • 迭代循环机制贡献最大(95分),它是整个系统的引擎
  • 持久化记忆(92分)解决了长程推理中的信息丢失问题
  • 分层监督(88分)显著提升了探索效率
  • 即使只加入基础的工具库和错误检测,也能带来明显提升

四、实际影响与适用场景

4.1 对个人开发者

能不能上手?

  • AVO 的核心思想(持久化记忆、分层监督、迭代循环)是通用的工程模式,可以用在任何 LLM 框架上
  • NVIDIA 已开源相关技术细节(见官方博客和论文),可以参考实现简化版

学习成本?

  • 中等偏高。需要理解 Agent 设计模式、状态管理、反馈控制等概念
  • 但一旦掌握,可以应用到代码生成、数据分析、自动化测试等多种场景

快速起步建议

from typing import TypedDict, List
import sqlite3

class AgentMemory(TypedDict):
    observations: List[str]
    hypotheses: List[str]
    verified_rules: List[str]
    failed_attempts: List[str]

class SimpleAVO:
    def __init__(self, model, memory_db: str = "agent_memory.db"):
        self.model = model
        self.conn = sqlite3.connect(memory_db)
        self._init_memory_table()
    
    def _init_memory_table(self):
        self.conn.execute("""
            CREATE TABLE IF NOT EXISTS memories (
                id INTEGER PRIMARY KEY AUTOINCREMENT,
                content TEXT,
                category TEXT,
                created_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP
            )
        """)
    
    def run_loop(self, environment, max_steps: int = 100):
        for step in range(max_steps):
            state = environment.observe()
            relevant_memory = self._query_memory(state)
            
            action = self.model.decide(state, relevant_memory)
            result = environment.execute(action)
            
            self._update_memory(state, action, result)
            
            if result.is_terminal:
                return result
        
        return None  # 达到步数上限
    
    def _query_memory(self, state: str) -> List[str]:
        cursor = self.conn.execute(
            "SELECT content FROM memories WHERE category IN ('rule', 'hypothesis')"
        )
        return [row[0] for row in cursor.fetchall()]
    
    def _update_memory(self, state, action, result):
        if result.success:
            self.conn.execute(
                "INSERT INTO memories (content, category) VALUES (?, ?)",
                (f"In state '{state}', action '{action}' worked", "verified_rule")
            )
        else:
            self.conn.execute(
                "INSERT INTO memories (content, category) VALUES (?, ?)",
                (f"Action '{action}' failed in state '{state}'", "failed_attempt")
            )
        self.conn.commit()

(以上为伪代码示例,展示 AVO 核心思想的简化实现)

4.2 对企业/团队

能否替代现有方案?

  • 如果你的 Agent 应用涉及多步骤、长周期任务(如自动化测试、数据处理流水线、代码重构),AVO 的架构思想值得借鉴
  • 对于简单的一问一答场景(客服机器人、摘要生成),过度设计反而增加复杂度

接入成本与风险?

  • 成本:中等。主要投入在架构设计和记忆管理上,不需要更换底层模型
  • 风险:较低。AVO 本身是对现有 LLM 的增强,即使效果不佳也可以回退到原生方案

实际案例参考
NVIDIA 在发布 AVO 之前,已在自动 GPU 内核优化任务上验证了该架构:同一系统连续运行 7 天,探索了 500 多个内核优化方向,提交了 40 个版本,部分配置的性能超过了手工优化的 FlashAttention 实现。这说明 AVO 不仅适用于游戏式基准测试,在真实的工程优化场景同样有效。

4.3 对AI生态

填补了哪块空白?

  • 当前 Agent 研究过于关注"模型能力提升"(更大的参数、更多的训练数据)
  • AVO 证明了系统工程同样重要:好的 Harness 可以让中等模型发挥出顶尖水平
  • 为"如何评估 Agent 系统"提供了新视角:不应只看模型得分,还要看完整系统的表现

可能冲击谁?

  • 纯模型厂商(OpenAI、Anthropic 等):客户可能不再单纯追求最新模型,而是关注如何用好现有模型
  • Agent 框架开发商(LangChain、AutoGen 等):AVO 的设计理念可能会被整合进下一代框架
  • Benchmark 设计者:ARC-AGI-3 可能需要升级,因为 AVO 已经"刷爆"了当前版本

五、冷静视角:边界、风险与未解问题

尽管 AVO 的成绩令人瞩目,但作为理性观察者,我们需要看到以下几点:

1. 评测范围的局限性

  • ARC-AGI-3 目前只有 25 个公开环境、183 个关卡,样本量相对有限
  • 这些环境都是网格世界的抽象谜题,与现实世界的复杂性仍有距离
  • NVIDIA 尚未公布在私有测试集上的表现(ARC-AGI-3 包含隐藏环境)

2. 计算成本问题

  • AVO 在达到 100% 通关率的过程中,使用了 6,624 次环境动作
  • 虽然比 VISTA 少 12%,但相比人类玩家的几百步仍然昂贵
  • 如果按 API 调用计费,单个任务的成本可能高达数千美元

3. 泛化性待验证

  • AVO 在 ARC-AGI-3 上表现出色,但这是否能迁移到其他领域?
  • 例如:代码生成、科学实验设计、商业决策支持等场景是否同样有效?
  • 目前缺乏跨领域的系统性评估

4. 团队背景引发的讨论

  • AVO 团队成员包括 Terry Chen、Yeyin (Eva) Zhu、Zhifan Ye、Humphrey Shi 等,其中多位是华人研究者
  • NVIDIA 整体研发团队中华人占比约 40%(据公开报道)
  • 这再次引发了关于"全球 AI 人才分布"和"华人学者贡献"的话题讨论

5. 与其他方案的对比缺失

  • 目前 NVIDIA 只公布了与 VISTA 的对比,缺少与其他 Agent 框架(如 LangGraph、CrewAI)的直接比较
  • 社区期待看到更多第三方复现和独立评测

6. 时间效率未披露

  • NVIDIA 公布了动作次数,但未披露总耗时
  • 如果一个任务需要运行数小时甚至数天,在实际应用中的实用性会打折扣

总结

这件事的核心价值:NVIDIA AVO 用 100% 的通关率证明了一个被长期忽视的观点——在 Agent 系统中,Harness(系统架构)的设计可能与模型本身同等重要。通过持久化记忆、分层监督、迭代循环等工程手段,AVO 将 Claude Opus 5 的推理效能放大了 3 倍以上。

谁应该关注

  • 正在构建复杂 Agent 应用的开发者和架构师
  • 对 AGI 基准测试和评估方法论感兴趣的研究者
  • 寻找 AI 投资方向的企业决策者(提示:不要只看模型参数,要看系统工程能力)

下一步怎么看

  • 短期:关注 NVIDIA 是否开源 AVO 的完整实现(目前只发布了论文和博客)
  • 中期:等待社区在更多场景下的复现和对比测试
  • 长期:观察这种"Harness-first"的设计理念是否会成为 Agent 工程的主流范式

对于普通开发者而言,即使暂时无法直接使用 AVO,其设计思想已经为我们提供了宝贵的参考:与其等待下一个 GPT,不如先把手头的模型用到极致


#NVIDIA #AVO #ARC-AGI-3 #Agent #AI智能体 #持久化记忆 #AGI基准测试

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐