论文

针对使用工具的代理的可执行基准测试套件

An Executable Benchmarking Suite for Tool-Using Agents

智能体系统Agent任务评测

摘要

使用闭环工具的代理越来越多地在可执行网络、代码和微任务环境中进行评估,但基准报告经常将工作负载、动作生成驱动程序以及面向系统的声明所承认的证据混为一谈。我们提出了一个可执行的基准测试套件,使这些对象在共享证据接纳合同下变得明确。该套件通过通用工作负载适配器、任务清单、事件模式、重放/冻结策略、声明的驱动程序和报告管道连接 WebArena Verified(具有 SWE 基准兼容验证的 SWE-Gym 切片)和 MiniWoB++。在规范版本中,该门将纸面证据与预检、固定装置、烟雾和诊断行分开,同时保留未承认的工件以供审计和入职。承认的证据记录了一份可审计合同下的延迟、无效操作行为、补丁生成成本、验证者元数据、重放绑定和出处。该门与决策相关而不仅仅是文书:在单独的 WebArena Verified 控制器研究中,干净基线和中等实时压力评估在相同的工作负载和准入合同下选择不同的固定控制器变体。该版本的范围是基准测试套件和公认的证据,而不是新的代理策略、模型排行榜、后端比较或自主 SWE 基准求解器。