代理基准是否如他们所说的那样?使用工具的Agent环境的可执行合同审计
Do Agent Benchmarks Do What They Say? An Executable-Contract Audit of Tool-Using Agent Environments
摘要
使用工具的Agent正在进入错误操作会带来实际成本的设置,并且基准测试证明它们对每个模拟工具调用的报告所做的事情进行评分,假设该工具做了其界面所宣传的事情。我们调查的审计分类法没有发布该假设的类别,并且每次重新运行时都会出现低于分数的缺陷。我们将工具的广告表面视为可执行合同,检查其实施情况,并通过任务文件和评估器代码跟踪每个分数的出处,直到从有缺陷的工具应编写的状态得出的结论。在四个基准测试中的 34 个经过审计的变异工具中,我们在固定提交中确认了七个工具缺陷和一个评估器属性。对于注入的缺陷,检查员在 25 个标记中没有提出假阳性,在 5 个阴性对照中标记了 2 个,并且错过了大部分:在 33 个评分错过的 29 个中,一个条款涵盖了缺陷,但没有探针揭示它。检查器自己的静态一半单独运行,标记 17 个已确认站点中的 14 个,因此动态一半对这些发现进行确认和跟踪,而不是发现。另外 12 个 AgentDojo 工具(其中 6 个保留工具和 7 个首先审核的工具)完成了其 25 个工具的变异表面,其中至少 5 个工具在我们的合同读取时偏离了其广告表面(仅 AgentDojo 的比率)。没有金轨迹达到任何 tau2-bench 缺陷;在为隔离电信缺陷而建造的 1,120 条路径上(这些路径是通过施工修复的),评估器会奖励对暂停线路进行加油,并使修复的工具失败。最明显的案例是临床基准,其工具告诉Agent在记录的无写设计下执行的每个写入,其接口未公开;它的分级器将该消息作为证据,因此其操作成功率记录请求是否携带预期的有效负载,而不是记录是否发生更改。