如果你的 AI 智能体总是重复犯同样的错误,未必应该先去找更昂贵的模型。NVIDIA 在 ARC-AGI-3 上的结果表明,比起模型瞬时的智能,能够记忆、验证并在受阻时调整方向的工作系统,才决定了长程任务的成败。

3秒摘要
模型执行行动 记录结果 通过评估器验证 监督者检测停滞 调整策略后重试

拿下100分的主角并非“更聪明的模型”

NVIDIA 公开的 AVO(Agentic Variation Operators)不是一种新语言模型,而是面向长时间自主工作的智能体系统。主智能体调查情况、制订计划并执行,然后评估结果;持久记忆和工具则让这一过程得以延续。独立的监督智能体会在探索停滞或反复出现同一种失败时,将其转向另一种策略。

测试舞台是 ARC-AGI-3。这是一个交互式推理基准:在不告知规则或目标的陌生二维环境中,智能体必须观察行动的效果、推断游戏目标,并解决越往后越困难的关卡。它考察的不是一次输出正确答案,而是提出假设、采取行动,然后修正错误假设的能力

100.00
AVO 的公开集 RHAE
183
完成的关卡总数
6,624
在环境中采取的行动数

AVO 基于 Claude Opus 5,完成了公开集25个环境中的全部183个关卡,取得 RHAE 100.00。RHAE 不只是简单的正确率:它同时计算关卡是否完成,以及相对于人类首次尝试的行动效率。100分意味着它完成了所有游戏和关卡,效率达到或超过人类基准。

TechCrunch 注意到的数字,是 Claude Opus 5 约30%的模型评估与 AVO 系统100%之间的差距。不过,不能将它解读为一项证明“仅靠一个框架就准确提升70个百分点”的对照实验。NVIDIA 也明确指出,两项结果在推理设置、智能体系统和评估配置上不同,因此这不是直接测量 AVO 单独贡献的比较。

100分并不等于宣布实现了 AGI

本次结果来自题目公开的25个环境,并不是半公开或私有竞赛集的结果。ARC Prize 也警告说,不应将针对公开环境调优的框架分数解读为通用智能的进展。公开分数可以展示编排框架工程的经济价值,但它能否原样泛化到首次接触的工作,仍需单独验证。

编排框架不是提示词的包装,而是工作的操作系统

在实际工作中,编排框架不是贴在模型前后的一层薄代码。它是决定传递哪些上下文、允许哪些工具、如何判定结果、以及哪些内容保存到下一次执行的执行层。如果模型负责“能思考什么”,框架则负责让这种能力不会在漫长任务中途消失。

失败场景 只更换模型时 应在框架中修复的点
每次执行都从头开始调研 选择上下文更长的模型 将假设、尝试和结果结构化后持久化保存
重复同一错误 在提示词中加入“请注意” 在执行前检查失败特征和重试限制
说已完成,但结果错误 再请求一次自我评估 接入测试、模式、静态分析等外部判定器
长任务中偏离目标 用更强的模型重新执行 由独立监督者定期检查目标、进度和成本

其中第一个杠杆是记忆。OpenAI 也报告称,在 ARC-AGI-3 中,让 GPT-5.6 Sol 保留先前推理,并压缩而非丢弃旧记录后,其公开集分数从13.3%升至38.3%,输出 token 则降至约六分之一。其解释是,如果只保留过去的行动,却丢掉“为什么这样行动”,智能体就会在每一轮重新解释问题。

第二个是观察的表达方式。MIT 的 VISTA 在同样的公开25个游戏中,将原始状态放大的 PNG 传给 Claude Opus 5,并加入可在需要时按原样重新调取过去观察的视觉记忆,取得了 RHAE 100。相比之下,AVO 不使用图像,而是输入精确的64×64文本网格。二者都成功,并不意味着存在唯一正确的接口;这表明,让模型无损观察并在需要时重新找回相关历史的设计才是关键。

第三个是监督与验证的分离。AVO 的主智能体负责调查、修正和执行,监督者则在更长的探索轨迹中监控停滞和重复。这不同于要求模型“自己检查做得好不好”,而是设置一个拥有独立状态和终止条件的监督层。不过,NVIDIA 的实验并非分别测量记忆和监督者效果的消融研究,因此不能断言仅靠一个监督者就拿到了100分。

比基准测试更重要的是我们工作中的失败循环

将这一结果应用到产品开发时,结论并不是“让所有智能体都变成多智能体”。首先要拆解失败究竟源于模型知识不足、记忆丢失、工具错误,还是缺少完成判定。在长任务中,代价最高的错误往往不是一次答错,而是错误状态悄悄传播到下一步。

实际上,研究长期文档编辑、覆盖52个专业领域的 DELEGATE-52 测试了19个 LLM,并报告称,即使是前沿模型,在任务结束时平均也损坏了文档内容的25%。仅仅增加工具使用并未提升性能,文档越大、交互越长、干扰文件越多,损坏越严重。这是一个反例:只接入工具并不能让智能体变得可靠。

实务判断标准:比较一次回答的质量时,看模型基准;比较由多个步骤组成的自动化时,评估模型、记忆、工具、验证器和恢复策略构成的完整系统。

因此,智能体性能表不能只放成功率。还应同时查看完成率、人工介入次数、同一失败的重复率、验证失败后的恢复率,以及每个完成任务的 token、时间和成本。ARC-AGI-3 的 RHAE 也同时衡量完成情况和行动效率,不改变环境的内部推理或工具调用不会计入行动数。若要判断服务成本,还需要在基准分数之外记录模型调用量和执行时间。

将框架设计应用到自家智能体的4个步骤

1. 先固定失败复现集

收集实际工作中失败的20到50个案例,保存输入、预期结果和容许误差。为代码工作添加测试通过率和改动范围等可机械判定的标准,为研究添加来源有效性,为数据工作添加模式和行数。每次更改模型、提示词或框架时,都应重新运行同一套案例,才能分辨是真正改进还是偶然。

2. 将记忆分为“完整对话”和“工作台账”

将完整对话作为可压缩的参考记录保留,同时把目标、已确认事实、尝试过的方法、失败原因、生成文件和剩余工作,以 JSON 或数据库记录等结构化形式单独保存。上下文满了时,不要盲目删除旧消息;先检查工作台账的必填项是否保留,再进行摘要。不要在台账中记录敏感信息和凭证。

3. 用数字定义监督者的介入条件

不要只说“需要时帮忙”,而应设置触发条件,例如同一错误2次、无进展的工具调用5次、达到预期成本的80%,或测试失败3次。监督者不应代替执行工作,而应读取当前假设、失败记录和剩余预算,并返回继续、改变策略、呼叫人工或停止中的一种结果。

4. 更换模型前先运行框架消融测试

从基线版本开始,逐一加入记忆保留、压缩、外部验证器和监督者,并记录完成率与成本的变化。若同时启用多个功能,就无法知道哪个因素产生了效果。只在最后更换模型并重复相同测试,就能区分模型效应和系统效应。

如果想进一步深入

NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents — 可同时了解 AVO 的记忆、监督结构、公开集结果和比较局限。 developer.nvidia.com

ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence — 说明该基准的设计目的,以及为何不应将公开框架分数解读为 AGI 的进展。 arxiv.org

ARC-AGI-3 Scoring Methodology — 可阅读结合完成率与相对人类行动效率的 RHAE 计算方法原文。 docs.arcprize.org

How enabling two settings tripled our scores on the ARC-AGI-3 benchmark — OpenAI 的实验,展示保留推理和压缩上下文如何改变分数与 token 用量。 openai.com

VISTA: A Visual Harness for Reasoning in an Interactive World — 可比较另一种获得100分的框架:它使用视觉输入和无损的历史观察记忆。 vista-research.github.io

LLMs Corrupt Your Documents When You Delegate — 探讨长期委派任务中错误累积的问题,以及仅接入工具无法解决的局限。 arxiv.org