论文
超越孤立的任务:用于评估顺序软件演化的 编码智能体 的框架
Beyond Isolated Tasks: A Framework for Evaluating Coding Agents on Sequential Software Evolution
摘要
编码智能体 的现有数据集以无状态方式评估孤立的单个拉取请求 (PR) 任务的性能,无法捕捉现实世界软件开发的现实,即代码更改累积、技术债务累积以及测试套件随着时间的推移而增长。为了弥补这一差距,我们引入了一个自动编码任务生成框架,该框架有助于生成我们的数据集 SWE-STEPS,该框架通过反映实际开发人员工作流程的两个现实设置来评估长期任务上的 编码智能体:带有迭代请求的会话编码和基于单次项目需求文档 (PRD) 的编码。与评估脱节拉取请求 (PR) 代理的现有数据集不同,我们的框架评估跨依赖 PR 链的性能,从而能够评估顺序执行、回归验证和长期存储库运行状况。我们发现,广泛使用的孤立公关评估会产生过高的成功率。我们的设置 - 性能超出了多达 20 个百分点 - 因为它们忽略了以前低效或有错误的代码的“溢出”效应。此外,我们的分析表明,即使代理成功解决了问题,与人类开发人员相比,它们也会生成具有更高认知复杂性和技术债务的代码,从而降低存储库的健康状况,这强调了多维评估的必要性。