论文
通过轨迹感知评估进行高效的 SWE 代理基准测试
Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation
摘要
在实际基准上评估软件工程代理的成本很高,因为每个任务可能需要多步骤的代码探索、修改和测试执行。现有的高效评估方法选择代表性子集来估计全基准性能,但很大程度上仅限于结果:它们适合历史通过/失败响应矩阵或静态任务语义,而忽略了代理如何解决问题。我们提出了 PTA-IRT,一种融合过程和结果信号的特权轨迹感知项目响应理论框架。历史执行轨迹提供超越通过/失败的流程级证据,例如探索的上下文、尝试的编辑和解决路径,PTA-IRT 将其用作校准子集选择和能力估计的特权信息。在较低的校准预算下,PTA-IRT 在四个 SWE 基准的分数和排名恢复方面始终优于之前的 IRT 基线。代码和数据可在 https://github.com/DeepSoftwareAnalytics/PTA-IRT 上公开获取。