论文

编码智能体怎样优化软件并报告性能验证?开源 PR 的大规模实证研究

How Do Coding Agents Optimize Software and Report Performance Validation? A Large-Scale Empirical Study of Open-Source Pull Requests

智能体系统Agent任务评测

摘要

软件性能优化需要识别瓶颈和改进机会,并通过实证评估性能目标的影响和权衡。自主人工智能编码智能体向开源项目提交面向性能的拉取请求 (PR),但目前尚不清楚这些更改是否反映了既定的优化实践并充分证实了其声称的价值。我们扩展了对 407 个性能 PR 的 MSR 2026 软件仓库挖掘挑战试点研究,分析了截至 2026 年 6 月收集的 1,130 个 Agentic 和 1,130 个人工编写的性能 PR 样本。我们比较了两组之间的采用结果和补丁特征,并检查了他们的优化实践和验证行为。结果显示,Agentic PR 的合并频率低于人类创作的 PR(54.4% 与 73.3%),但两组使用相似的优化策略并以相当的比率报告验证。 Agentic PR 更多地依赖静态推理,较少依赖基准(46.1% vs. 57.2%),尽管基准使用在研究期结束时趋同。 Agentic PR 还报告对代码异味重构的验证,就像对针对资源使用的修改的验证一样,而人工编写的 PR 这样做的频率较低。在这两个群体中,大约一半的经过验证的 PR 没有报告定量性能指标,并且相关的权衡很少被量化。 Agentic 优化实践已经变得越来越类似于人类实践,但支持证据仍然不完整。确定智能体提出的优化是否得到严格、定量和多维证据的支持仍然是一个重要的挑战。这些发现激发了评估基础设施和审查标准,以衡量预期效果和相关成本,而不是仅将验证的存在视为充分。

编码智能体怎样优化软件并报告性能验证?开源 PR 的大规模实证研究的原论文方法或结果图
图 2:数据集构建。从 AIDev 定义的存储库框架开始,我们挖掘在扩展观察窗口期间提交的 PR,使用 AIDev 的归因信号将它们分类为 Agentic 或人类创作的 PR,保留那些分类为性能相关的,应用严格的人类创作的过滤器和质量标准,并抽取 Agentic 和人类创作的性能 PR 的 1:1 每周分层样本。表 2 报告了每个阶段保留的 PR 的程序和数量。