论文

LLM提议、执行器裁决:区分长程Agent中的承诺漂移与绑定漂移

The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents

智能体系统Agent HarnessAgent任务评测

摘要

如何验证一个长期的代理,其状态和自我报告都是不可信任的?我们构建了一个代理仪器,使其验证过程结构化而非事后处理。一个确定性的执行者拥有所有信念;语言模型只能提交类型化的提案,并且只有当在行动前注册的预测与观察相匹配时才被接受。两个特性使该仪器成为其科学的验证者,而不是仅仅对代理进行验证:每一次运行都会自动否定自己,当操作错误、尺寸或盐水警报地板被破坏(前三次八进制运行中的四次都被否决,每种缺陷都定位到一个真实缺陷);以及在删除测试机制后,渲染不可见的阴影参考编译了全系统将要执行的所有计划,因此即使测试机制被移除,偏差指标仍然定义。使用这个仪器,我们报告了一个失败的长期代理上的单一变量结果:取消承诺机制将目标放弃从0.00变为1.00,而错误绑定保持在0.00(每种细胞有三个种子,总共394次参考节奏,每种运行都被有效控制)。相反,绑定通道在删除其修复时不再出现——因为绑定是代码所有,失败类别结构化地吸收了,其唯一残留物出现在一层之上,作为形成假设的崩溃。我们报告这些结果,以公开的方式表明任务效用为零(在52次受控运行中,所有52个栅栏运行都达到了零级完成度),预先注册为结构性缺陷者。贡献是验证方法和它使可测量的偏差分解。