论文
AgentLens:揭示 SWE-Agent 评估中的幸运通行证问题
AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
摘要
软件工程(SWE)代理的评估由二进制信号主导:最终补丁是否通过测试。这种只注重结果的观点将原则性解决方案和混乱的试错过程视为等同。我们证明这种等价性在经验上是错误的。我们在 60 个 SWE 基准验证任务上评估了来自 8 个模型后端的 2,614 个 OpenHands 轨迹。其中,47 个具有足够的通过轨迹来构建任务级流程参考,从而产生 1,815 个轨迹评估子集。在这个子集中的通过轨迹中,10.7% 表现出我们称之为“幸运通行证”的行为:回归循环、盲目重试、缺少验证或暂时无序的探索、实施和验证。我们引入了 AgentLens,一个用于 SWE-agent 轨迹的过程级评估的框架,并定义了 AgentLens-Bench,这是一个由 1,815 个轨迹组成的数据集,注释有质量分数、浪费信号、分歧点和 47 个任务级前缀树接受器 (PTA) 参考。 AgentLens 通过合并同一任务的多个传递解决方案来构建 PTA 参考,并使用上下文相关的意图标签器根据轨迹历史记录(而不是单独的工具标识)将操作分配给探索、实施、验证或编排。在 AgentLens-Bench 上,质量得分将传球轨迹分为幸运、可靠和理想三个级别,并进一步将幸运传球分解为五种循环机制。在八个模型后端中,幸运率范围从 0.5% 到 23.2%,某些模型在按质量得分而不是通过率排名时移动了多达 5 个排名位置。我们计划很快发布项目存储库,包括 AgentLens-Bench 工件、AgentLens SDK 和分析工具。