论文
CoRE:超越输出预测的细粒度代码推理基准
CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction
摘要
尽管在代码生成任务上表现强劲,但仍不清楚 大语言模型 (LLM) 是否真正推理代码执行。现有的代码推理基准主要评估单个规范实现下的最终输出正确性,而有两个关键方面尚未得到充分探索:(1)LLM 是否可以保持与功能等效实现的一致性,以及(2)LLM 是否可以准确地推理中间执行状态。我们引入 \textbf{CoRE},一个 \textbf{Co}de \textbf{Re}asoning 基准,通过 \textbf{实现不变性} 和 \textbf{过程透明度} 评估代码推理。对八个前沿 LLM 的广泛评估揭示了两个基本限制。首先,模型表现出巨大的鲁棒性差距,在等效实现中性能差异很大。其次,我们观察\textbf{表面执行},其中模型在没有正确推理中间执行状态的情况下达到正确的最终输出。总之,这些发现表明,仅输出评估不足以评估代码推理,并将 CoRE 定位为评估稳健和忠实代码推理的必要基准。\footnote{数据和代码可在 https://github.com/ZJUSig/CoRE 上获取。}