论文

PerfCodeBench:针对系统级高性能代码优化的 LLM 基准测试

PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization

模型评测基准与评测资源

摘要

大语言模型 (LLM) 通常可以生成功能正确的代码,但它们为性能关键型系统任务生成有效实现的能力仍然有限。现有的代码基准测试主要强调正确性或算法问题的解决,而现实的系统级优化仍然没有得到充分探索。为了弥补这一差距,我们引入了 PerfCodeBench,这是一个用于评估 LLM 高性能代码优化的可执行基准测试。这些任务需要系统级实现选择、硬件感知优化以及仔细处理性能瓶颈。每项任务都包括可执行的正确性检查、基线实施和参考优化解决方案。这使我们能够评估正确性和面向运行时的效率。我们对一系列最先进的 LLM 的评估显示了模型生成的代码和专家优化的实现之间存在明显的差距。在涉及并行性和 GPU 操作的任务上,差距尤其大。当前的模型还显示出跨语言鲁棒性和持续达到专家级效率方面的弱点。这些结果表明仍然需要进行性能感知评估。 LLM 应该超越仅仅生成正确的代码,转向生成高效的系统软件。我们在 https://anonymous.4open.science/r/perfcodebench-7CDE 提交了所有 LLM 生成的代码的基准数据、评估基础设施和完整日志。