论文

评估 LLM 的实际软件性能优化

Evaluating LLMs on Real-World Software Performance Optimization

模型评测基准与评测资源

摘要

软件性能优化是一项非常复杂的手动任务。尽管越来越多地使用 大语言模型 (LLM) 进行代码优化,但我们仍然缺乏捕获实际代码库中优化如何实际发生的基准。现有框架通常通过关注孤立的功能或单个性能指标来过度简化问题,而忽略了执行时间和内存占用之间的关键权衡、测量环境的固有噪声以及不同输入数据和执行条件引入的可变性。我们通过引入 SWE-Pro 来解决这个问题,这是一个存储库级基准,源自开源项目的 102 个专家编写的优化。与之前的基准测试不同,SWE-Pro 将每个任务与参数化测试配对,以在噪声感知测量条件下评估不同输入数据和执行条件的运行时间、峰值内存和时间加权内存使用 (TWMU)。我们的评估表明,当前的 LLM 表现非常挣扎:运行时增益可以忽略不计,并且内存优化几乎不存在。这与专家实现形成鲜明对比,专家实现比基准任务实现了 15.5 倍的总体加速和 171.3 倍的峰值内存减少。在 91.2% 的运行时任务和 65.7% 的峰值内存任务中观察到专家编写的改进。我们的研究结果揭示了当前 LLM 能力与专家级工程需求之间存在巨大差距。