论文

Goal-Autopilot:适用于无人值守长视野代理的可验证反伪造防火墙

Goal-Autopilot: A Verifiable Anti-Fabrication Firewall for Unattended Long-Horizon Agents

智能体系统Agent HarnessAgent Runtime

摘要

长视野 LLM 代理不被信任在无人值守的情况下运行:在没有人类监视的情况下,它们自信地报告从未验证过的成功。我们将诚实——限制智能体在终止时可能提出的要求——视为无人值守自主权的一流指标,与能力不同。我们推出了自动驾驶仪(Autopilot),这是一种执行模型,它使无声的制造成功在结构上变得不可能,而不仅仅是更加罕见。自动驾驶仪将所有工作状态外部化为一个持久的、门控的有限状态机,调度程序一次推进一个无状态的刻度;硬地板禁止任何终端“完成”声明,其可伪造的门实际上并未执行和通过。我们证明了一个无假成功定理——在门的健全性、楼层执行和计划覆盖范围下,终止意味着目标成立——其唯一的信任点是可以凭经验测量的,并且表明最坏的情况会退化为诚实的停滞,而不是捏造的成功。因为每个刻度仅重新水化状态机,所以每步上下文成本在范围内是恒定的。在 3,150 个细胞配对语料库中(70 个任务 $\times$ 3 个系统 $\times$ 3 个模型 $\times$ 5 个种子,包括跨 11 个 OSS 存储库的 50 个 SWE-bench Lite 任务),Autopilot 在 0.95% 的单元上构建 [95% CI 0.38--1.62],而 Reflexion 和 StateFlow 基线在 8.10% 上构建分别为[6.48--9.81]和25.05%[22.48--27.62]。头条对比存在于硬机制中:在 SWE-bench Lite 上,防火墙将制造量从 33.7% (StateFlow) 减少到 0.67%,成对差异为 $-33.07$ pp [95% CI $-36.53, -29.73$]。该机制是门,而不是模型:所有十个自动驾驶仪制造都来自最强的模型,而两个较弱的中层模型从未在 700 个配对单元中制造。防火墙在设计上用覆盖范围来换取诚实——诚实的停顿是可以恢复的;自信地向下游输送错误的输出则不然。