论文

元智能体挑战:当前智能体有能力自主开发智能体系统吗?

The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?

智能体系统AI 基础设施Agent HarnessAgent任务评测SandboxAgent Sandbox

摘要

当前的人工智能基准评估代理在人工设计的工作流程中执行任务的情况。这些评估从根本上无法衡量关键的下一级能力:模型是否可以自主开发代理系统。我们引入了元代理挑战(MAC),这是一个评估框架,旨在测试自主代理开发前沿模型的能力。具体来说,为代码代理(元代理)提供沙盒环境、评估 API 和时间限制,以迭代地对代理工件进行编程,从而最大限度地提高跨五个域的测试集的性能。为了确保评估的完整性,该框架通过针对奖励作弊的多层防御来保护。利用这个框架,我们证明元代理很少能够与人类设计的基线策略相匹配,并且少数能够匹配的元代理主要由专有的前沿模型主导。此外,设计过程表现出高方差和高优化压力,表面出现了新兴的对抗行为,例如地面实况渗透,突出了鲁棒性和模型对齐方面的关键缺陷。最终,MAC 为自主人工智能研究和开发提供了严格的开源基准,为评估递归自我改进提供了经验代理。基准测试可在以下网址公开获取:https://github.com/ant-research/meta-agent-challenge。

元智能体挑战:当前智能体有能力自主开发智能体系统吗?:论文配图
图 1:元代理挑战 (MAC) 说明。左:传统评估直接在静态基准上测试代理能力。随着模型能力的激增,这种直接方法很快就会饱和。右:我们提出的元评估范式。智能体不是直接解决任务,而是根据其自主构建、完善和优化智能体系统来解决任务的能力进行评估。该框架通过将评估重点从单纯的任务执行转移到自主系统工程能力来最大化现有基准的效用。