论文

LLM 理解执行语义的能力如何?

How Robustly do LLMs Understand Execution Semantics?

模型评测鲁棒性、公平性与可信度评测

摘要

LLM 展示了卓越的推理能力,但它们是否利用内部世界模型或依赖复杂的模式匹配仍然是开放的。我们使用标准程序输出预测任务,通过代码理解的稳健性来研究 LLM。我们的结果揭示了模型行为的明显差异:虽然开源推理模型(DeepSeek-R1 系列)在代码转换和输入扰动下保持稳定,尽管精度稍低(38% 至 67%),但前沿模型 GPT-5.2 表现出明显的脆弱性。尽管在原始、未受干扰的 CRUXEval 基准上获得了近乎完美的 99% 分数,但受干扰的输入触发准确度却下降了 20% 到 24%。此外,我们发现许多模型在预测引发异常的扰动输入的行为方面表现较差,并且预测性能取决于异常的类型。我们研究补救措施来解决异常预测中的这一缺陷,并评估这些补救措施对预测非异常行为的能力的影响。我们的研究结果既指出了所有模型理解代码的方式的局限性,又确立了使用扰动来评估代码模型的价值。