论文
编码智能体怎样优化软件并报告性能验证?开源 PR 的大规模实证研究
How Do Coding Agents Optimize Software and Report Performance Validation? A Large-Scale Empirical Study of Open-Source Pull Requests
摘要
软件性能优化需要识别瓶颈和改进机会,并通过实证评估性能目标的影响和权衡。自主人工智能编码智能体向开源项目提交面向性能的拉取请求 (PR),但目前尚不清楚这些更改是否反映了既定的优化实践并充分证实了其声称的价值。我们扩展了对 407 个性能 PR 的 MSR 2026 软件仓库挖掘挑战试点研究,分析了截至 2026 年 6 月收集的 1,130 个 Agentic 和 1,130 个人工编写的性能 PR 样本。我们比较了两组之间的采用结果和补丁特征,并检查了他们的优化实践和验证行为。结果显示,Agentic PR 的合并频率低于人类创作的 PR(54.4% 与 73.3%),但两组使用相似的优化策略并以相当的比率报告验证。 Agentic PR 更多地依赖静态推理,较少依赖基准(46.1% vs. 57.2%),尽管基准使用在研究期结束时趋同。 Agentic PR 还报告对代码异味重构的验证,就像对针对资源使用的修改的验证一样,而人工编写的 PR 这样做的频率较低。在这两个群体中,大约一半的经过验证的 PR 没有报告定量性能指标,并且相关的权衡很少被量化。 Agentic 优化实践已经变得越来越类似于人类实践,但支持证据仍然不完整。确定智能体提出的优化是否得到严格、定量和多维证据的支持仍然是一个重要的挑战。这些发现激发了评估基础设施和审查标准,以衡量预期效果和相关成本,而不是仅将验证的存在视为充分。
