论文

超越输出正确性:编码任务中的 大语言模型 推理基准测试和评估

Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越依赖显式推理来解决编码任务,但评估这种推理的质量仍然具有挑战性。现有的推理评估器并不是为编码而设计的,当前的基准测试主要集中在代码生成上,而其他编码任务在很大程度上尚未探索。我们推出了 CodeRQ-Bench,这是第一个评估 LLM 推理质量的基准,涵盖三个编码任务类别:生成、摘要和分类。使用这个基准,我们分析了现有评估者的 1,069 个不匹配案例,识别了五个重复出现的限制,并得出了编码任务中推理评估的四个设计见解。在这些见解的指导下,我们提出了 VERA,这是一种两阶段评估器,它将基于证据的验证与模糊性感知分数校正相结合。 CodeRQ-Bench 上的实验表明,VERA 在四个数据集上始终优于强基线,将 AUCROC 提高了 0.26,将 AUPRC 提高了 0.21。我们在 https://github.com/MrLYG/CodeRQ-Bench 发布了 CodeRQ-Bench,支持未来的调查。