论文

AgentBeats:智能体化智能体评估以实现开放性、标准化与可复现性

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

智能体系统智能体互操作协议Agent任务评测MCPA2A

摘要

代理系统正在跨领域快速发展,但它们的评估仍然分散。大多数基准测试都依赖于固定的、以大语言模型为中心的工具,这些工具需要大量集成,造成测试与生产不匹配,并限制不同代理设计之间的公平比较。根本问题是缺乏开放的、与代理无关的评估界面。我们提倡代理代理评估(AAA),其中评估由法官代理执行,所有参与者通过标准化协议进行交互:用于任务管理的 A2A 和用于工具访问的 MCP。传统的基准测试定义了两个独立的接口,一个用于基准测试,一个用于代理,而AAA只需要一个;这产生了一个通用的、统一的框架,将评估逻辑与代理实施分开,并实现可重复、可互操作和多代理评估。我们进一步介绍 AgentBeats 作为 AAA 的具体实现:我们确定了五种实际操作模式,使标准化评估与现实世界对开放性、隐私性和可重复性的限制相兼容。为了大规模评估我们的设计,我们进行了两项研究:一项为期 5 个月的公开竞赛,吸引了 12 个类别的 298 名评测智能体以及来自独立参与者的 467 名被测智能体,表明 AAA 适用于各种不同的基准;一项关于编码代理的案例研究证实,代理化评估保留了对公共记录的保真度,同时揭示了之前缺失的面对面结果,从而产生了有关代理设计的研究见解。结合社区规模的现场研究和受控编码案例研究,我们验证了 AAA 在大规模异构场景中提供了覆盖范围、实用性和保真度。 AAA 和 AgentBeats 共同为开放、标准化和可重复的代理评估提供了一条清晰的道路。

AgentBeats:智能体化智能体评估以实现开放性、标准化与可复现性:论文配图
图 2. 基准测试和代理之间完全分离。传统基准与固定代理工具紧密结合,通常只允许 LLM 更换,如绿色阴影区域所示,而代理基准允许交换整个代理。