论文

用于代码语义推理的经过执行验证的多语言基准

An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning

模型评测基准与评测资源

摘要

评估 大语言模型 (LLM) 是否可以恢复与执行相关的程序结构,而不仅仅是生成通过测试的代码,仍然是一个悬而未决的问题。现有的代码基准测试强调测试通过输出,从独立编程任务(HumanEval、MBPP、LiveCodeBench)到存储库修复(SWE-Bench);这很有用,但提供了关于模型可以从源恢复哪些程序语义的有限诊断信号。我们介绍了 TraceEval,据我们所知,这是第一个经过执行验证的、用于代码语义推理的多语言基准:从源代码恢复程序的运行时调用结构。与之前依赖静态工具输出或手动注释 真值 的调用图基准测试不同,TraceEval 中的每个上升沿都由验证执行机械地见证,从而消除了观察到的行为的注释者分歧和标签噪声。 TraceEval 包含 (i) 10,583 个真实程序(2,129 个测试,8,454 个训练),通过带有跟踪器验证的 LLM 辅助工具生成管道从 Python、JavaScript 和 Java 的 1,600 多个开源存储库中提取; (ii) 一个可复制的管道,可将任何开源存储库转换为新的经过验证的基准实例。我们在保留测试拆分上以零样本评估 10 LLM。最强的模型 Claude-Opus-4.6 在三种语言中的平均 F1 达到 72.9%。为了证明列车分割作为监督基板的实用性,我们对其上的 Qwen2.5-Coder 系列进行了微调:高达 +55.6 F1 的提升将调整后的 Qwen2.5-Coder-32B 提升至 71.2%,在零样本 Claude-Opus-4.6 的 1.7 F1 范围内。我们在 https://github.com/yikun-li/TraceEva 发布了基准测试、管道、基线和数据表