SaltBench:一种裁判门控协议,用于测量机器检查软件工作中的方法效果
SaltBench: A Referee-Gated Protocol for Measuring Method Effects in Machine-Checked Software Work
摘要
SaltBench 是针对一个问题的基准协议:机器裁判如何改变 编码智能体 的工作方式?机器裁判员——证明内核、程序验证者或保留的测试套件——决定代理的工作价值,并且代理无法与之争论。在这里,我们报告了一个协议,使裁判的效果可测量,并且其答案无法在事后叙述:每个结果都是在代理自己的工具链之外决定的;代理与网络、参考解决方案和Harness本身隔离开来,并且在任何评分运行之前通过尝试突破隔离墙的探针对隔离墙进行测试,因此隔离是观察到的而不是假设的;每次运行均经过注明日期的冻结授权,并记录了其预测;预算停止只是停止,绝不是失败。在本研究中,基准测试的主题是“座位”,意思是在其标准Harness中的座席会话。我们测试了五个系统组件,全部在固定的 Verus 工具链下用 Rust 编写,并用保留的测试套件作为每个组件的裁判。测试了四个手臂:普通特工;代理还被指示创建规范并根据其验证代码,以简化的方法呈现,如注册的;以及先验提供规范的两个臂,根据对 $k=4$ 的日期修正案进行扩展,其中注册符号测试未得出结论(4 中的 3,$p = 0.3125$,每个保费都低于可解决的下限)。我们发现,该部门被指示在所有五个组件上指定和验证成本更高,并且具有实际利润:在这五个组件中,在声明的集合的任何读数下,溢价均不超过 2.8879 美元×$,而最便宜的三个组件低于 1.4 美元×$。这个界限是这个群体的财产,而不是对较大个体的承诺:最小组件的溢价接近 1 美元,并且随着尺寸的增加而增加。我们发布完整的记录。