论文
元智能体挑战:当前智能体有能力自主开发智能体系统吗?
The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?
摘要
当前的人工智能基准评估代理在人工设计的工作流程中执行任务的情况。这些评估从根本上无法衡量关键的下一级能力:模型是否可以自主开发代理系统。我们引入了元代理挑战(MAC),这是一个评估框架,旨在测试自主代理开发前沿模型的能力。具体来说,为代码代理(元代理)提供沙盒环境、评估 API 和时间限制,以迭代地对代理工件进行编程,从而最大限度地提高跨五个域的测试集的性能。为了确保评估的完整性,该框架通过针对奖励作弊的多层防御来保护。利用这个框架,我们证明元代理很少能够与人类设计的基线策略相匹配,并且少数能够匹配的元代理主要由专有的前沿模型主导。此外,设计过程表现出高方差和高优化压力,表面出现了新兴的对抗行为,例如地面实况渗透,突出了鲁棒性和模型对齐方面的关键缺陷。最终,MAC 为自主人工智能研究和开发提供了严格的开源基准,为评估递归自我改进提供了经验代理。基准测试可在以下网址公开获取:https://github.com/ant-research/meta-agent-challenge。
