论文

用于经济高效的软件工程代理回归测试的轨迹感知基准子集选择

Trajectory-Aware Benchmark Subset Selection for Cost-Efficient Software Engineering Agent Regression Testing

智能体系统Agent任务评测

摘要

自主软件工程代理(SWE-agent)可自动执行编码任务。每次代理更新可能需要重新运行完整的基准测试来检测回归和改进,每次运行的成本为数亿个 LLM 词元,这使得评估成为瓶颈。一种解决方案是仅评估基准实例的子集。然而,简单的方法,例如基于过去的通过/失败结果的随机抽样或分层随机抽样,有产生高方差和不具有代表性的子集的风险。我们转向智能体轨迹,即智能体所采取行动的逐步记录。我们提出了一种轨迹感知子集选择方法,该方法用基于轨迹嵌入的确定性选择代替随机采样。我们首先根据最近完整测试运行中的测试结果对测试集实例进行分组,以保留历史通过/失败率,然后使用轨迹的嵌入空间选择子集。我们在三种回归场景中评估了 76 个子集选择配置,包括随机采样、基于嵌入的选择、基于聚类的选择和混合候选名单然后子样本策略:相同配置重新运行、模型和配置更改以及代理框架更改。我们最好的轨迹感知方法是选择最接近嵌入空间中每个结果组的质心的基准实例。在我们评估的所有方法中,它实现了最低的估计误差。例如,当在选定的 5% 或 10% 测试实例子集上评估给定代理版本时,我们的方法相对于典型抽签将平均估计误差降低了 3--11%,最坏情况误差降低了 4--11%,相对于最强基线的 95% 抽签降低了 38--46%。我们的结果表明,10% 的轨迹感知子集可将中值估计误差保持在 5% 以下,同时将词元成本降低约 90%。