论文

重新思考 LLM 的代码性能基准

Rethinking Code Performance Benchmarks for LLMs

模型评测基准与评测资源

摘要

人们提出了许多功能级性能基准来评估大语言模型(LLM)是否可以生成高效的程序。然而,这些基准测试的结果通常表明,LLM 生成的实现与规范解决方案的执行时间差异很小或没有差异。在本文中,我们重新审视四个流行的基准测试:EffiBench、Enamel、EvalPerf 和 Mercury。我们在更严格的设置下评估了 1,538 个任务,每个任务运行 30 次,并通过统计测试评估规范解决方案和基准提供的性能实现之间的运行时差异。使用基准提供的测试套件,只有 6.11% 的性能实现明显快于规范解决方案。在对 308 个非重要任务的手动分析中,99 个高性能实现不包含任何有意义的性能变化,而 209 个包含原始测试未暴露的潜在性能改进。这些结果表明,主要的局限性不仅在于评估方法,还在于基准测试提供的性能测试的充分性有限。为了解决这个限制,我们提出了一个基于 LLM 的多代理框架来生成面向性能的测试,该测试比原始测试更有效地暴露运行时差异。该框架使用三个独立的代理来生成、诊断和修复确定性测试,以保留功能正确性,同时更好地暴露性能差异。在原始测试没有发现显着性能差异的 1,345 个基准任务中,我们的框架使用 DeepSeek-v3.1 和 GPT-4o 生成的测试显示,分别有 24.01% 和 25.43% 的任务有统计上的显着改进,优于基于 SOTA LLM 的性能测试生成方法。