英伟达公布的一项最新研究显示,在需要连续完成多步决策的 AI 任务中,真正拉开表现差距的,可能不是底层模型,而是围绕模型搭建的执行框架。这套系统负责记忆、上下文、反馈和工具调用,是模型从回答问题走向执行任务的关键部分。
Claude Opus 5 升至 100%
研究中,英伟达团队为 Claude Opus 5 配置了一套定制化执行框架,并加入类似“监督者”的上层代理组件。结果显示,该模型在交互式推理基准 ARC-AGI-3 上取得 100% 成绩。
如果不使用这套框架,Claude Opus 5 的得分为 30%。即便如此,这一成绩仍已是测试模型中的最高水平之一。英伟达据此认为,模型能力固然重要,但在长任务场景下,外围系统设计的影响更大。
长任务更依赖纠偏能力
所谓长任务,是指 AI 需要在较长时间内串联多次判断,最终完成一项工作,而不是只对单个提示作答。这类任务一直是 AI 代理研究中的难点,因为模型在执行过程中容易偏离目标,或在中途陷入无效探索。
英伟达产品副总裁 Adel El Hallack 表示,外界常把代理理解为模型接口,但实际系统远不止模型本身。它还包括工具集、运行环境,以及支持任务推进的各类能力模块。
文章提到,微软今年 4 月测试 19 个大模型处理文档编辑类长任务时,发现包括前沿模型在内的系统都产生了大量错误。此前也有模型在自主执行过程中误删文件、删除数据库,甚至为达成目标采取越界行为。
监督代理成为关键设计
英伟达此次选用的 ARC-AGI-3 是一组没有文字说明的二维互动游戏,模型需要自行摸索规则并完成目标。100% 的成绩意味着系统在这类任务中的表现已达到可稳定通关的水平。
文章还提到,OpenAI 旗下模型此前在 ARC-AGI-3 上得分不足 10%,随后也通过调整执行框架参数,将成绩提升至原来的约 3 倍。但其结果仍未达到英伟达研究中的水平。
英伟达认为,差异的关键之一在于加入了“监督代理”。这一组件会在主代理卡住、偏航或重复走旧路径时介入,推动系统回到更有效的方向。研究团队将其比作对执行过程进行纠偏的上层角色。
同一模型成本也会分化
英伟达将这套方法称为 Agentic Variation Operators,简称 AVO。不过文中说明,这并不是一款新产品,而是研究团队基于现有技术搭建的执行框架。英伟达目前通过 Nemo 品牌提供多种构建代理框架的技术组件,其中一部分商业化,另一部分则开放使用。
这项研究也呼应了近期业内的另一项观察:同一模型搭配不同执行框架,成本和效果都可能出现明显差异。Databricks 此前就表示,框架选择本身可能让 AI 使用成本相差一倍。
英伟达借此强调,开放式代理框架的重要性正在上升。公司认为,用户若能控制执行框架、基础设施和运行环境,就能更细致地调整代理表现,并在提升准确率的同时改善安全性。











