论文

ADK Arena:通过 LLM-as-a-Developer 评估代理开发套件

ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer

模型评测基准与评测资源

摘要

代理开发套件 (ADK) 和用于构建 LLM 驱动的自主代理的 SDK 级框架的快速增长,已经超过了对框架选择如何影响代理性能的任何实证理解。我们提出 \textbf{LLM-as-a-Developer},这是一种用 LLM 编码智能体 代替人类开发人员的方法,该方法从文档中学习每个框架的 API,编写代理代码,并通过验证和反馈循环迭代修复它,直到测试通过。通过保持开发人员不变并仅改变框架,生成工作成为 API 可用性的定量代理,并且生成的代理提供了框架有效性的受控测量。我们在 \textbf{ADK Arena} 中实现这一点,这是一个完全自动化的管道,具有每个框架 Docker 隔离、一个三级验证管道以及用于 SWE-bench、$τ^2$-bench、Terminal-Bench 和 MCP-Atlas 的基准适配器。评估所有 51 个流行的 Python ADK 框架(204 个代理 - 基准对),我们发现:(1)~生成在 57% 的运行中成功,并且其成本在不同框架之间变化 5.6$\times$(每个代理 \$0.6 到 \$3.4),这是 API 复杂性的定量代理,尽管仅成本并不能预测成功; (2)~没有单一框架占主导地位:最好的单基准 ADK 代理可以解决高达 80\% 的任务,甚至可以以一小部分成本\emph{击败}通用前沿 编码智能体,但中值框架只能解决 32\%; (3)~在信息源消融方面,真正的框架使用率保持在狭窄的 28--40% 范围内(原始源访问最高,在没有参考资料的情况下仍为 33%),这表明文档、源代码和参数知识在很大程度上是可替代的,而不是任何一个都成为硬瓶颈。