英伟达近日发布了一项引人注目的新研究,表明在让AI完成长时间任务时,关键不在于底层模型,而是“驾驭系统”(harness)。所谓驾驭系统,是指包裹在AI模型外部的软件层,包括工具、内存管理和规则,这些将原始模型转变为能够自主行动的智能体。

简而言之,研究人员通过使用一个专门优化内存管理并包含“监督者”组件的定制驾驭系统,使Claude Opus 5在互动推理基准测试ARC-AGI-3中获得了100%的满分。该测试包含一系列无指导的二维游戏,模型必须像人类一样摸索规则并获胜。相比之下,未使用该驾驭系统时,Opus 5的得分仅为30%,但这已是所有测试模型中的最高分。

这项研究再次表明,虽然模型选择重要,但模型本身——作为智能体“大脑”的部分——在智能体系统中所占比重远小于许多AI用户的想象,尤其是在长时间任务中。驾驭系统才是让模型成为智能体的关键,它负责管理记忆、上下文和反馈。

英伟达AI部门产品副总裁Adel El Hallak向TechCrunch解释:“通常人们把智能体看作模型的API,但智能体实际上远不止于此。它是模型本身,是围绕模型的支架,也就是我们称之为驾驭系统的一套工具。它包括运行时环境以及赋予智能体的技能和库。”

长时间任务需要将多个决策串联起来,可能持续数天,最终完成一项工作。这与AI仅仅对提示作出回应截然不同。如何让AI在执行长时间任务时不偏离目标,是智能体研究中的重要难题。

例如,微软今年四月发布的研究测试了19个大型语言模型在文档编辑等长时间任务中的表现,发现所有模型,包括最先进的,都在文档中产生了大量错误。如果是人类完成这样的工作,早已被解雇。

此外,自主串联决策的模型也曾出现删除用户文件、破坏数据库,甚至采取犯罪行为(如勾结、黑客攻击)以达成目标的情况。

英伟达选择使用互动推理基准测试ARC-AGI-3进行测试,意义重大且颇具讽刺意味。满分意味着模型能像人类一样通关游戏。

OpenAI因其模型在该测试中得分低于10%而感到尴尬,上月也进行了相关研究。与英伟达类似,OpenAI发现仅通过调整驾驭系统中的两个设置,模型得分就提升了三倍,但仍未接近100%。英伟达的研究表明,驾驭系统需要一个“监督者”组件,当智能体陷入困境时,能引导其回到正确轨道。

El Hallak表示:“更有趣的是,除了执行任务的主智能体外,我们引入了一个监督智能体。它几乎像CEO一样,当智能体偏离方向、走入死胡同时,或重复走过的路时,给予提醒和引导。”

虽然监督智能体的概念并非新鲜事物,但目前大多数智能体用户仅依赖单层驾驭系统,如Claude Code、Codex或Hermes。英伟达研究人员开发了名为Agentic Variation Operators(AVO)的强化驾驭系统。

需要说明的是,这并非英伟达的新产品,而是其Nemo品牌下提供的多种开源技术组件,供构建驾驭系统使用,其中部分为商业技术,更多为开源资源。

英伟达的研究结果进一步证明,模型选择并非影响智能体性能的唯一因素。今年7月,Databricks发布的研究也显示,驾驭系统对AI成本的影响远大于模型本身。

Databricks CEO Ali Ghodsi告诉TechCrunch:“你可以选择同一个模型,但使用不同的驾驭系统,成本可能相差一倍。人们往往只关注模型的价格,却忽略了驾驭系统的影响。”

英伟达强调,开放的驾驭系统和开放模型一样,能让用户获得更大的控制权。

El Hallak说:“我们相信并通过生态系统展示,开放的驾驭系统让用户可以调节更多参数,从而提升准确率。这也与OpenAI因模型引发安全漏洞而放缓训练进度有关。”

他补充道:“我们认为,开放的智能体架构——涵盖驾驭系统、基础设施和运行时——是推动生态系统安全前进的关键。”