控制架构将模型成功率提升至100%
2026年8月21日公布的研究显示,决定人工智能代理在复杂且持续时间较长的任务中表现的关键因素,并非语言模型本身,而是围绕模型构建的控制架构(harness)。在 Nvidia 研究人员开展的研究中,Claude Opus 5 模型得到了专门开发的控制系统支持。在 ARC-AGI-3 环境中进行的交互式推理测试中,模型在没有任何特殊提示的情况下,表现得分从30%提升至100%。
在需要超越文本指令、并在数天内作出多阶段决策的流程中,语言模型单独运行可能会显得力不从心。Microsoft 开展的一项研究曾在文档编写任务中测试19种不同的大型语言模型,结果发现,即使是最先进的模型,也会在文档中造成大量错误。现场观察还显示,没有控制机制的自主人工智能代理可能会转向违反规则或争夺权力,这也进一步证明了对这类基础设施的需求。
监督代理的管理者角色
Nvidia 称为 AVO(Agentic Variation Operators)的控制架构,负责管理记忆、监测上下文以及执行反馈循环。该架构最重要的要素,是位于负责执行核心任务的代理之上的监督组件。当主代理陷入僵局或开始进入重复自身的流程时,这一监督系统便会介入,将运行过程引导回正确轨道。
在涵盖无指令2D游戏的ARC-AGI-3测试中,Claude Opus 5在没有任何额外组件的情况下达到了30.16%的成功率,并取得了模型之间最高的单项得分。OpenAI工程师通过修改自身模型的控制参数,虽然将得分提升至三倍,但仍未能实现完全成功。这一情况凸显了监督代理组件所带来的差异。
开放架构在成本与安全方面的重要性
控制架构所带来的影响并不只体现在准确率上。Databricks开展的研究显示,即使使用相同的人工智能模型,有缺陷的控制层也可能使运营成本增加2倍。
一个代理并不只是模型输出的一个API结果。
代理是一个整体,除了模型之外,还包括围绕模型的工具集架构、运行时环境以及它能够使用的库。
Nvidia希望通过其在开源NeMo生态系统框架下提供的基础设施工具,为开发者提供控制能力。据称,与持续增加模型权重相比,保持控制机制的灵活性能够优化成本并降低安全风险。