论文

PERFOPT-Bench:评估 编码智能体 的软件性能优化

PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization

智能体系统Agent任务评测

摘要

编码代理基准测试在很大程度上衡量了代理是否可以生成功能正确的补丁,但生产软件还要求对实际执行目标进行可测量的加速。性能优化是一项独特的代理任务:代理必须分析执行情况、诊断跨层瓶颈、在不破坏正确性的情况下编辑代码,并验证增益是可重现的而不是测量工件。我们推出 PERFOPT-Bench,这是一个评估完整性能工程循环的基准。每个任务都提供一个正确但故意次优的代码库,并要求代理改进目标性能指标;评分需要隐藏的正确性测试、验证加速测量和轨迹级审核。我们在 7 个长期优化任务上评估了具有不同 LLM 和代理框架的 7 个代理堆栈。结果表明,优化性能取决于工作负载,而不是仅由模型身份决定:没有单一堆栈占主导地位,并且更改代理框架可以显着改变相同 LLM 的每任务加速配置文件。我们进一步发现,原始加速作为基准分数是不安全的,因为一些巨大的收益来自特定于基准的快捷方式利用;探索性中继试点表明,从外部化优化摘要重新启动可以在初始会话停止后恢复额外的空间。基准测试和我们的评估可在以下网址获取:https://anonymous.4open.science/r/Dataset-D3CC。