论文

CodeGolf Bench:评估大语言模型简洁代码生成能力的多语言基准

CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models

模型评测基准与评测资源

摘要

本文介绍了 Code Bench,这是一个能够评估 60 种编程语言的 大语言模型 (LLM) 简洁代码生成能力的基准测试。该基准测试基于 Code Golf(一项专注于最小字符或字节解决方案的休闲编程竞赛),提供了 LLM 生成高效、简洁代码的能力的独特衡量标准。与受固定问题集和语言覆盖范围限制的现有基准测试不同,CodeGolf Bench 利用 code.golf 平台提供新问题和实时人类表现基准。对 Python 和 C++ 任务上的 9 个 LLM 的评估表明,推理模型显着优于非推理模型,实现了 70.97% 的最佳平均百分位数。这种性能差距在 C++ 中尤其明显,凸显了推理对于具有严格语法要求的语言的重要性。非推理模型在两种语言的效率优化方面更加困难,最佳百分位数明显低于推理模型。 CodeGolf Bench 提供了一个动态框架,用于根据不断变化的人类代码高尔夫表现来评估 LLM 代码生成能力。