论文

循环并不可靠:用于代理代码修复的状态绑定证据和类型化修订合同

Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair

智能体系统Agent 动作执行与治理

摘要

生成-测试-修改循环在 编码智能体 中很常见,但仅重复并不能提供可靠性保证。我们研究找到正确补丁与保留、验证和提交补丁之间的差距。一项密封的五种子研究超过 30 次 HumanEval 修复,产生了 900 个三修改轨迹。在强制修订下,当前轨迹的当前正确性从一次修订后的 0.820 下降到两次修订后的 0.673,尽管永远正确性上升至 0.847。两项共同状态研究使用来自相同冷冻项目的 2,430 个分支来消除治疗后风险设置偏差。在预先指定的 14B 复制中,过时跟踪会损害 34/135 正确启动,而当前跟踪会损害 4/135,增加了 22.2 点(任务集群 95\% CI $[8.9,37.0]$,确切的 Holm $p=0.0337$)。预期的 包含540条执行轨迹的策略实验消除了观察到的正确启动损害,但减少了错误启动修复并未能满足其联合标准。超过 24 个错误和四个编码器堆栈的存储库实验揭示了底层效应和组件异质性,而没有 Holm 显着效应。因此,我们将准入、保存、基础认证、能力和活力分开。我们派生出一个证据绑定的类型化循环合约,并在参考实现中实例化其机械可执行的子集,该参考实现将验证者证据绑定到确切的代码状态,保留经过验证的检查点,并发出可审计的准入收据。该实现是可执行的规范和一致性工件,而不是改进的修复能力或校准验证器依赖性的证据。