论文

超越通过率:开放代码LLM的多语言执行锚定评估

Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

模型评测模型能力评测

摘要

代码生成模型通常使用紧凑的执行基准和聚合通过率进行比较,但这样的总结掩盖了性能在编程语言、问题族和故障模式之间的差异。我们对 9 个可公开访问的大语言模型进行了大规模、以执行为基础的评估,这些硕士专门针对 12 种编程语言的 2,707 个免费 LeetCode 问题进行编码。我们的语料库包含 325,343 个问题模型语言作业,每个作业都链接到提示元数据、提取的代码、LeetCode 执行结果和静态分析信号。结果表明,当前的开放模型距离人类接受度参考值还很远:最好的模型 Yi-Coder-9B-Chat 的平均正确率达到 23.64%,而人类接受度基线为 57.2%。排名也与切片相关:Qwen2.5-Coder-14B-Instruct 在硬问题和独特问题覆盖率方面最强,而 Gemma-2-27B-IT 实现了最高的全语言 lint 通过率。失败分析显示,在未接受的最佳提交中,编译错误占了 63.25%,这表明许多失败发生在语义正确性无法测试之前。静态质量进一步偏离功能正确性。总之,这些发现表明,多语言、保留工件的评估揭示了单语言或单指标排行榜隐藏的权衡。

超越通过率:开放代码LLM的多语言执行接地评估:论文配图
(a) 总体功能表现。显示每个模型的平均正确性,并与人类接受基线进行比较。(b) 模型的接受问题覆盖率。尽管 Qwen 的平均正确率不高,但它涵盖了最广泛的问题。图 3:跨模型的整体功能性能和可接受问题覆盖率的比较。