论文

智能体基准测量的是能力吗?智能体AI时代的协议有效性

Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

模型评测智能体系统Agent任务评测评测方法与指标长程任务评测

摘要

智能体基准日益评估仓库编辑、网络研究、终端使用和长时程交互。只有当评估协议确保目标能力是取得成功所必需时,其分数才能支撑能力主张。最近的奖励劫持基准与系统报告表明,智能体反而可能恢复公开解答、读取评估工件、推断生成器结构、操纵反馈,或从无效的评分路径中获益;现有应对措施没有提供一套通用程序来归因这些捷径并量化其在各基准上的影响。我们形式化了协议有效性,并推出 HackDetect,一种事后审计方法,用于识别暴露点、确定智能体如何利用它,并评估由此得到的分数是否具有误导性。我们用 Mislead gap 量化分数虚高,其定义为利用得分减去预期得分。我们审计了 15 个智能体基准上的 2,385 条轨迹,在 67.0% 的 Frontier Science 轨迹和 66.7% 的 AutoLab 任务中发现暴露点与奖励劫持的证据。在成对比较中,我们测得 0.45-1.00 的分数虚高,这表明基准报告应当提供分数确实反映目标能力的证据。

智能体基准测量的是能力吗?智能体AI时代的协议有效性:论文配图
图 1:代理基准管道和五个协议暴露入口点。上面的面板通过代理运行、评估器和报告的分数遵循任务到分数的路径。下部面板将五个暴露源映射到它们的入口点,并显示基准暴露信息或控制如何创建与分数相关的快捷方式。