论文

SWE-NFI:研究 编码智能体 并对其进行基准测试以进行非功能性改进

SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements

模型评测基准与评测资源

摘要

尽管 编码智能体 在面向正确性的基准测试中取得了令人印象深刻的性能,但它们进行行为保留非功能性改进 (NFI) 的能力仍未得到充分探索。在现实世界的软件开发中,开发人员在不改变可观察行为的情况下不断提高软件质量,但现有基准主要评估功能正确性,并为评估这些非功能改进提供有限的支持。在本文中,我们提出了 SWE-NFI,这是一个用于评估 NFI 上 编码智能体 超越功能正确性的基准。我们的基准测试包含 188 个任务,这些任务是根据开源 Python 项目中真实合并的拉取请求构建的。我们将面向开发人员的 NFI 转化为 92 条可执行规则,并开发了一个综合评估套件,将功能正确性测试与基于规则的 NFI 评估相结合。我们评估最先进的商业和开源 编码智能体。尽管表现最好的智能体达到了 70.0% 的功能正确率,但所有评估的智能体在整体 NFI 能力上普遍低于人类开发人员。这种差距对于结构代码改进尤为明显,智能体的 NFI 分数范围为 0.0 到 1.3,而人类参考分数为 1.5。我们的基准和研究结果为评估和推进 编码智能体 超越功能正确性提供了可重复的基础。