英伟达AI刷爆ARC-AGI-3!AVO Harness架构让Agent从30%飙升到100%
英伟达AI刷爆ARC-AGI-3!AVO Harness架构让Agent从30%飙升到100%
关键词:NVIDIA AVO、ARC-AGI-3、Agent Harness、持久化记忆、分层监督、自主推理
目录
一、导语:为什么这条消息值得关注
2026年8月21日,NVIDIA官方博客发布重磅消息:其研发的 AVO (Agentic Variation Operators) 系统在 ARC-AGI-3 基准测试中达到 100% RHAE 分数,成功通关全部 183 个关卡,跨越 25 个陌生环境——而作为基础模型的 Claude Opus 5 单独测试时仅得 30.2%。
这个结果的震撼之处在于:差距并不来自换了更大的模型,而是来自模型之外的系统架构设计。AVO 通过引入持久化记忆、分层监督、迭代循环等机制,将同一模型的推理能力放大了 3倍以上。对于正在构建 AI Agent 的开发者来说,这意味着"模型能力不是天花板,Harness 设计才是";对于企业用户,这提示我们在选择 Agent 方案时应该更关注系统工程而非单纯追求参数规模;对于研究者,AVO 为"如何让 LLM 在长周期任务中保持高效推理"提供了一个可复现的工程范式。
二、ARC-AGI-3到底是什么?最严苛的AGI测试
2.1 不是什么
ARC-AGI-3 不是:
- 一个传统的 NLP 基准测试(如 MMLU、GSM8K 那样有标准问答格式)
- 一个图像识别任务(不依赖预训练视觉模型的知识迁移)
- 一个有明确规则和目标说明的任务(Agent 进入环境时完全"蒙在鼓里")
- 一个可以通过暴力搜索或穷举解决的简单谜题(状态空间指数级爆炸)
2.2 是什么
ARC-AGI-3 (Abstraction and Reasoning Corpus for AGI, Version 3) 是由 ARC Prize Foundation 于 2026年3月25日 发布的交互式推理基准测试,专门用于衡量 AI 的类人通用智能能力。
它的核心设定是:
- Agent 被丢进一个 64×64 像素的网格游戏世界(类似简单的 2D 游戏)
- 没有规则说明书、没有任务提示、没有目标描述
- Agent 必须通过自主试错、观察反馈、总结规律来理解环境运作方式
- 每个环境包含多个关卡(level),Agent 需要找到通关条件并达成
- 测评指标是 RHAE (Relative Human Action Efficiency),即相对于人类最优解的动作效率比
公开集包含 25 个环境、183 个关卡,涵盖逻辑推理、模式识别、空间操作、因果推断等多种认知能力。
2.3 为什么这么难
ARC-AGI-3 的难度体现在三个维度:
- 零样本泛化要求:每个环境的规则都是全新的,无法通过训练数据覆盖
- 长程推理压力:部分关卡需要数十甚至上百步才能发现规律并完成目标
- 探索效率约束:动作次数直接影响得分,盲目试错会导致低分
这也是为什么顶级前沿模型在这个测试上的表现如此惨淡:
| AI 系统 | ARC-AGI-3 得分 | 备注 |
|---|---|---|
| NVIDIA AVO + Claude Opus 5 | 100% ✅ | 全部 183 关通关 |
| Claude Opus 5 (原生) | 30.2% | Anthropic 当前最强模型 |
| Claude Opus 4.8 (High) | 1.5% | 花费 $10,000/任务 |
| GPT-5.4 (High) | 0.26% | OpenAI 前沿模型 |
| GPT-5.5 (High) | 0.4% | OpenAI 更新版本 |
| Grok-4.20 (Beta) | 0.00% | xAI 模型完全失败 |
数据来源:ARC Prize 官方 Leaderboard 及 NVIDIA 博客 (2026年8月)

(上图:ARC-AGI-3 性能对比图,NVIDIA AVO 以 100% 完成率碾压所有顶级大模型)
三、核心揭秘:AVO如何把30%拉到100%
3.1 AVO架构全景图
AVO (Agentic Variation Operators) 是 NVIDIA 开发的通用型 Agent 系统架构,专为长周期自主任务设计。它不是一个新的语言模型,而是一套围绕现有 LLM 构建的 Harness(套索/框架系统)。

(上图:AVO 系统架构图,展示了主 Agent、监督器、记忆系统、工具库四大核心组件及其交互关系)
AVO 的核心组件包括:
| 组件 | 功能 | 技术实现 |
|---|---|---|
| 主 Agent | 执行具体推理和行动 | 基于 Claude Opus 5,负责环境交互 |
| 监督器 (Supervisor) | 监控整体进度,防止死循环 | 独立 Agent,可介入纠正方向 |
| 持久化记忆 | 跨步骤保留关键发现 | 结构化存储(SQLite),支持读写 |
| 工具与技能库 | 提供环境交互接口 | 任务特定的 API 封装 |
| 错误检测模块 | 实时监控执行偏差 | 反馈循环机制 |
3.2 持久化记忆:跨会话的"经验积累"
这是 AVO 与原生 LLM 最大的区别之一。
传统 LLM 的局限:
- 每次调用都是无状态的(stateless)
- 上下文窗口有限,早期发现容易被遗忘
- 无法跨关卡复用已验证的规律
AVO 的解决方案:
- 使用外部持久化存储(如 SQLite 数据库)
- 将关键发现以结构化形式保存(环境规则、有效策略、失败教训)
- 在后续步骤中主动检索相关记忆,避免重复探索
举个例子:如果 Agent 在第 5 关发现"红色方块碰到蓝色区域会触发传送",这个规律会被写入记忆库。当第 15 关出现类似机制时,Agent 可以直接调用该假设进行验证,而不是从头摸索。
3.3 分层监督:防止Agent"钻牛角尖"
长周期任务中,Agent 很容易陷入局部最优或死循环——反复尝试同一条错误路径而不自知。
AVO 引入了分层监督机制 (Hierarchical Supervision):
工作层级 (Worker Agent)
├── 负责具体的观察、推理、行动执行
├── 关注当前步骤的细节优化
└── 向监督器汇报进度和异常
监督层级 (Supervisor Agent)
├── 监控全局搜索轨迹
├── 检测重复模式或停滞信号
├── 在必要时强制调整策略(如"换个思路试试X方向")
└── 管理资源预算(总步数上限、时间限制)
这种设计类似于公司里的"员工+经理"关系:员工专注执行,经理把控方向。在 ARC-AGI-3 测试中,监督器帮助 AVO 避免了大量无效探索,使得总动作数比之前的 VISTA 系统少了 12%(6,624 vs 7,542)。
3.4 迭代循环:检查→规划→执行→评估
AVO 的核心工作流程是一个闭环迭代过程:

(上图:AVO 从零开始到完成任务的完整工作循环)
每个循环包含四个阶段:
- 环境观察 (Inspect):获取当前帧的状态信息
- 规划决策 (Plan):基于历史记忆和当前状态形成假设
- 行动实施 (Implement):执行选定的动作
- 结果评估 (Evaluate):分析反馈,更新记忆库
关键点在于:每次循环都会更新记忆和策略,而不是简单地重试。这使得 Agent 具备真正的"学习能力",而非随机搜索。
3.5 与原生模型的性能对比
为了量化 AVO 各组件的贡献度,我们从技术维度进行了拆解:

(上图:左图为 AVO vs 原生 LLM 在五项关键能力上的对比;右图为各组件的重要性评分)
核心洞察:
- 迭代循环机制贡献最大(95分),它是整个系统的引擎
- 持久化记忆(92分)解决了长程推理中的信息丢失问题
- 分层监督(88分)显著提升了探索效率
- 即使只加入基础的工具库和错误检测,也能带来明显提升
四、实际影响与适用场景
4.1 对个人开发者
能不能上手?
- AVO 的核心思想(持久化记忆、分层监督、迭代循环)是通用的工程模式,可以用在任何 LLM 框架上
- NVIDIA 已开源相关技术细节(见官方博客和论文),可以参考实现简化版
学习成本?
- 中等偏高。需要理解 Agent 设计模式、状态管理、反馈控制等概念
- 但一旦掌握,可以应用到代码生成、数据分析、自动化测试等多种场景
快速起步建议:
from typing import TypedDict, List
import sqlite3
class AgentMemory(TypedDict):
observations: List[str]
hypotheses: List[str]
verified_rules: List[str]
failed_attempts: List[str]
class SimpleAVO:
def __init__(self, model, memory_db: str = "agent_memory.db"):
self.model = model
self.conn = sqlite3.connect(memory_db)
self._init_memory_table()
def _init_memory_table(self):
self.conn.execute("""
CREATE TABLE IF NOT EXISTS memories (
id INTEGER PRIMARY KEY AUTOINCREMENT,
content TEXT,
category TEXT,
created_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP
)
""")
def run_loop(self, environment, max_steps: int = 100):
for step in range(max_steps):
state = environment.observe()
relevant_memory = self._query_memory(state)
action = self.model.decide(state, relevant_memory)
result = environment.execute(action)
self._update_memory(state, action, result)
if result.is_terminal:
return result
return None # 达到步数上限
def _query_memory(self, state: str) -> List[str]:
cursor = self.conn.execute(
"SELECT content FROM memories WHERE category IN ('rule', 'hypothesis')"
)
return [row[0] for row in cursor.fetchall()]
def _update_memory(self, state, action, result):
if result.success:
self.conn.execute(
"INSERT INTO memories (content, category) VALUES (?, ?)",
(f"In state '{state}', action '{action}' worked", "verified_rule")
)
else:
self.conn.execute(
"INSERT INTO memories (content, category) VALUES (?, ?)",
(f"Action '{action}' failed in state '{state}'", "failed_attempt")
)
self.conn.commit()
(以上为伪代码示例,展示 AVO 核心思想的简化实现)
4.2 对企业/团队
能否替代现有方案?
- 如果你的 Agent 应用涉及多步骤、长周期任务(如自动化测试、数据处理流水线、代码重构),AVO 的架构思想值得借鉴
- 对于简单的一问一答场景(客服机器人、摘要生成),过度设计反而增加复杂度
接入成本与风险?
- 成本:中等。主要投入在架构设计和记忆管理上,不需要更换底层模型
- 风险:较低。AVO 本身是对现有 LLM 的增强,即使效果不佳也可以回退到原生方案
实际案例参考:
NVIDIA 在发布 AVO 之前,已在自动 GPU 内核优化任务上验证了该架构:同一系统连续运行 7 天,探索了 500 多个内核优化方向,提交了 40 个版本,部分配置的性能超过了手工优化的 FlashAttention 实现。这说明 AVO 不仅适用于游戏式基准测试,在真实的工程优化场景同样有效。
4.3 对AI生态
填补了哪块空白?
- 当前 Agent 研究过于关注"模型能力提升"(更大的参数、更多的训练数据)
- AVO 证明了系统工程同样重要:好的 Harness 可以让中等模型发挥出顶尖水平
- 为"如何评估 Agent 系统"提供了新视角:不应只看模型得分,还要看完整系统的表现
可能冲击谁?
- 纯模型厂商(OpenAI、Anthropic 等):客户可能不再单纯追求最新模型,而是关注如何用好现有模型
- Agent 框架开发商(LangChain、AutoGen 等):AVO 的设计理念可能会被整合进下一代框架
- Benchmark 设计者:ARC-AGI-3 可能需要升级,因为 AVO 已经"刷爆"了当前版本
五、冷静视角:边界、风险与未解问题
尽管 AVO 的成绩令人瞩目,但作为理性观察者,我们需要看到以下几点:
1. 评测范围的局限性
- ARC-AGI-3 目前只有 25 个公开环境、183 个关卡,样本量相对有限
- 这些环境都是网格世界的抽象谜题,与现实世界的复杂性仍有距离
- NVIDIA 尚未公布在私有测试集上的表现(ARC-AGI-3 包含隐藏环境)
2. 计算成本问题
- AVO 在达到 100% 通关率的过程中,使用了 6,624 次环境动作
- 虽然比 VISTA 少 12%,但相比人类玩家的几百步仍然昂贵
- 如果按 API 调用计费,单个任务的成本可能高达数千美元
3. 泛化性待验证
- AVO 在 ARC-AGI-3 上表现出色,但这是否能迁移到其他领域?
- 例如:代码生成、科学实验设计、商业决策支持等场景是否同样有效?
- 目前缺乏跨领域的系统性评估
4. 团队背景引发的讨论
- AVO 团队成员包括 Terry Chen、Yeyin (Eva) Zhu、Zhifan Ye、Humphrey Shi 等,其中多位是华人研究者
- NVIDIA 整体研发团队中华人占比约 40%(据公开报道)
- 这再次引发了关于"全球 AI 人才分布"和"华人学者贡献"的话题讨论
5. 与其他方案的对比缺失
- 目前 NVIDIA 只公布了与 VISTA 的对比,缺少与其他 Agent 框架(如 LangGraph、CrewAI)的直接比较
- 社区期待看到更多第三方复现和独立评测
6. 时间效率未披露
- NVIDIA 公布了动作次数,但未披露总耗时
- 如果一个任务需要运行数小时甚至数天,在实际应用中的实用性会打折扣
总结
这件事的核心价值:NVIDIA AVO 用 100% 的通关率证明了一个被长期忽视的观点——在 Agent 系统中,Harness(系统架构)的设计可能与模型本身同等重要。通过持久化记忆、分层监督、迭代循环等工程手段,AVO 将 Claude Opus 5 的推理效能放大了 3 倍以上。
谁应该关注:
- 正在构建复杂 Agent 应用的开发者和架构师
- 对 AGI 基准测试和评估方法论感兴趣的研究者
- 寻找 AI 投资方向的企业决策者(提示:不要只看模型参数,要看系统工程能力)
下一步怎么看:
- 短期:关注 NVIDIA 是否开源 AVO 的完整实现(目前只发布了论文和博客)
- 中期:等待社区在更多场景下的复现和对比测试
- 长期:观察这种"Harness-first"的设计理念是否会成为 Agent 工程的主流范式
对于普通开发者而言,即使暂时无法直接使用 AVO,其设计思想已经为我们提供了宝贵的参考:与其等待下一个 GPT,不如先把手头的模型用到极致。
#NVIDIA #AVO #ARC-AGI-3 #Agent #AI智能体 #持久化记忆 #AGI基准测试
更多推荐


所有评论(0)