论文

评估实际程序中的精确输出和检查点状态预测

Evaluating Exact Output and Checkpoint-State Prediction in Real Programs

模型评测基准与评测资源模型能力评测

摘要

我们提出了一个仅从源和输入预测最终输出和检查点状态的基准。它通过循环内部和循环之后的成对的较短和较长跟踪输入以及检查点扩展了 CRUXEval 样式的输出预测。该基准测试包含来自 371 个 Python 和 C++ 程序的 400 个案例,在四个模型系列的七种设置下进行评估,无需工具或代码执行。在 11,200 个计划预测中,11,151 个产生了可分级的响应。在完成回答方面,启用推理的设置比未启用推理的设置高出 33.1 至 55.2 个百分点。最强设置在较短轨迹最终输出上得分为 93.0%,在较长轨迹最终输出上得分为 77.0%,在两个状态任务上得分为 65.5% 和 63.5%;当缺少响应被视为错误时,这些分数也成立。在 2,397 个具有相同源的匹配 Python 比较中,更改为较长跟踪输入会产生 528 个正确到错误的更改和 147 个反转。源聚类分析保留了这种准确性差距,而调整后的 Python 模型没有提供累积状态之间正增量关联的证据 负载和错误。更改的输入和检查点任务会一起改变多个因素,因此间隙不会隔离跟踪长度或内部状态跟踪机制。该基准测试暴露了仅由短输出分数隐藏的错误。