论文

当AI设计AI:创新还是模仿?

When AI Designs AI: Innovation or Imitation?

智能体系统Agent任务评测

摘要

LLM Agent的最新进展使其越来越有能力为复杂AI任务设计方法。相对于人类设计的方法,这引出两个核心问题:Agent设计的方法性能如何?其算法设计与人类设计的差异有多大?为研究这些问题,本文引入一种分析:从人类设计的方法中推导任务特定的算法设计空间,把人类设计与Agent设计的方法都映射进这些空间,并在模块层面量化二者的算法差异。我们在一组覆盖多种模态的代表性开放式AI任务上评估广泛使用的LLM Agent,并从任务性能以及与人类设计方法的算法差异两方面分析它们设计出的方法。实验结果显示,当前Agent偶尔能匹敌或超越人类最先进(SOTA)性能(72个配置中有10个),但这种成功并不能跨任务、跨Agent可靠泛化。此外,96.8%的Agent设计方法落在人类衍生的算法设计空间内,很大程度上是对人类设计方法中算法选择的重新组合,而近一半与某个已有人类算法设计完全一致。综合来看,这些发现表明:尽管当前Agent偶尔能匹敌或超越人类SOTA性能,其算法设计仍停留在人类衍生的算法设计空间之内,反映出对算法选择的复用与重组。