论文

CodeAssay:用于 LLM 代码生成的经过审核的 真值 多指标基准

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation

模型评测基准与评测资源

摘要

大语言模型 越来越多地使用基于测试的基准来评估代码生成。此类评估的有效性取决于其参考和测试的可靠性,而基于测试的正确性仅捕获生成代码的部分可观察属性。我们推出了 CodeAssay,这是一个分类优先的基准测试,涵盖 10 个软件工程类别的 185 个 Python 任务。它结合了经过审核的 真值、用于生成和修复的公共测试、用于分级的隐藏测试、基于突变的测试套件验证以及选定的代码属性度量。审计后对固定模型输出进行重新评级,更改了 1,890 个正确性标签中的 170 个(9.0%),并将测量的最佳到最差模型差异从 11.9 个百分点增加到 23.7 个百分点,但总体正确性几乎保持不变。完整和隐藏测试套件的突变分数分别为 82.6% 和 74.8%。在 7 个专有的 LLM 中,标准提示正确性范围为 77.3% 到 98.9%,21 个模型对中的 12 个模型对存在显着差异。在所有 14 种模型提示配置解决的 120 项任务中,没有一个模型在所有选定的代码属性上表现最佳。以安全为中心的提示不会对所选静态分析结果的正确性或一致减少产生重大影响,同时会增加所有模型的程序长度和圈复杂度。这些发现表明,对 LLM 生成的代码进行可靠评估需要经过验证的 真值、受保护的测试和多个显式解释的措施。 CodeAssay 为人工智能增强软件开发中基于证据的模型评估提供了可重复的基础。