论文
超越任务完成:工具进化代理中的验证与一致性差距
Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents
摘要
综合自己的工具的代理会在每个答案旁边提供第二个工件:未来任务重用、组合和依赖的软件库。任务完成(TC)证明答案;它不认证图书馆。在 Claude Haiku 4.5 试点中,我们修补了工具以保留每个工具的源代码,并根据保留的一致性套件重放每个合成工具。在 222 个保留的工具和三个协议中,96.8% 记录每个工具的正确性 C=0.00:两个协议静默腐烂率为 100%,一个为 91.7%。手写参考实现在所有 16 个功能套件上的得分 C=1.00。综合工具执行干净,会话中验证器不会提出任何标志;对于保留的输入,它们只是返回错误的答案。这是通过率基准无法看到的验证与一致性差距。 EvolveTool-Bench 使这一差距变得可测量。会议分为种子、差距、变体、组合、回归和对抗角色;运行会发出每个工具清单、经过验证的 TC 子集、正确与不正确的重用以及部署后监控的审核跟踪。在超过 5 个协议的 Haiku 试点中(3 个种子、8 个会话、每次通过 51 个经过验证的决策),TC 本身并不能分离协议;审计层负责。一个预先指定的对比显示,调整后的决策分割合成方案表现不佳,单次合成(-7.1 pp,95% CI [-13.9,-0.1];BH 校正后不显着)——一种假设生成信号,而不是确认的效果。我们发布了工具、每个工具的源代码保存、一致性回放和可重复性清单。这种形式的审计模式——验证者覆盖率、重用分解、保留一致性——是部署的工具演进代理在版本之间应发出的最低限度。