论文
CodegenBench:LLM 能否跨架构编写高效代码?
CodegenBench: Can LLMs Write Efficient Code Across Architectures?
摘要
虽然 大语言模型 (LLM) 已在通用编程和 GPU 加速环境(例如 PyTorch、CUDA)的代码生成任务上进行了广泛的评估,但它们在跨不同架构的面向 CPU 的高性能计算 (HPC) 方面的功能仍未得到充分开发。为了弥补这一差距,我们推出了 CodegenBench,这是一个全面的基准测试套件,旨在评估跨三个不同硬件平台(x86_64、Sunway 和 Kunpeng)高效并行代码的生成。我们的基准测试包括建立基本基线的 106 个标准基本线性代数子程序 (BLAS) 例程,以及适用于每种独特超级计算架构(LeetSunway 和 LeetKunpeng)的 20 个专用计算内核。我们的广泛评估表明,虽然最先进的 LLM 可以为 x86_64 等普遍存在的架构生成优化的代码,但它们在公共文档和训练数据有限的特定领域架构上表现出显着的性能下降,突出了跨平台泛化的关键局限性。此外,我们对影响代码质量的因素(例如实现长度和任务复杂性)的分析表明,当前的 LLM 对于需要简洁代码片段的中等难度问题最有效。我们开源我们的数据集和自动化评估基础设施,以促进 LLM 驱动的高性能代码生成的未来研究。这些资源位于 https://anonymous.4open.science/r/CodegenBench-EDE1/ 和 https://anonymous.4open.science/r/CodegenBenchDataset-2551。