论文

CTE-Bench:状态软件模拟器的反事实跟踪评估

CTE-Bench: Counterfactual Trace Evaluation for Stateful Software Simulators

模型评测基准与评测资源

摘要

编码Agent会更改正在运行的软件:它们修补服务的代码或覆盖其存储的状态,然后根据自己对服务随后将如何响应的期望采取行动。错误的期望可能会在几次调用后出现。功能级代码执行基准测试忽略持久服务状态,代理基准测试对Agent采取的操作或它达到的最终状态进行评分。我们引入了 CTE-Bench,它衡量模型是否可以预测干预如何改变有状态服务的未来行为,而不要求它选择操作。每个场景都给出了模型 Python 服务代码、干预前观察到的调用和响应、干预本身(源代码编辑或状态覆盖)以及 40 个固定的未来调用;该模型预测每个未来的响应,并通过执行服务来检查预测。三种内存协议控制模型是否看到正确的早期响应、没有看到正确的响应或它自己的早期预测。 CTE-Bench-Core-v1 包含 6 个确定性 Python 服务的 255 个场景,每个模型提供 10,200 个预测。主要得分是效果步骤值匹配 (VM):干预措施改变其响应的 2,476 个未来呼叫的精确响应相等。根据早期正确响应的揭示,四个 API 托管模型(DeepSeek V4-Flash、Kimi K2.5、Qwen3.6-35B-A3B 和 Claude Sonnet 4.6)达到了 54.3%-61.5% 效果步 VM。隐藏这些响应会将效果步 VM 降低至 23.2%-28.9%;以自我生成的预测为条件,给出了 24.8%-33.2%,最多 1.2% 的场景是端到端准确预测的。因此,当前的模型主要在提供正确反馈时跟踪干预效果,并且它们的错误会随着rollout而复合。我们发布了 CTE-Bench-Core-v1,其中包含可执行的预言机、评估脚本以及将每个声明映射到其协议的评估卡。