论文

重建档案:代理应用程序重建的机械强制规范,以及模型层故障揭示的内容

Rebuild Dossier: Mechanically-Enforced Specs for Agentic App Rebuilds, and What Model-Tier Failures Reveal

智能体系统Agent Harness

摘要

人工智能代理的重建效果取决于生成它的过程。之前的工作发现,一旦模型足够强大,多代理重建管道就会输给最简单的方法:为模型提供原始代码和一条指令(AgentModernize)。我们提出了重建档案,这是一种开源工具,它可以在编写任何代码之前锁定应用程序的真实接口(其确切的输入和输出),然后通过自动检查(而不是单独编写指令)强制执行一次测试构建。三个结果形成了本次评估,其证据数量各不相同。首先,在一个小比较中,合规代理未能通过保留测试,而违反规则的代理则通过了所有测试 - 证明通过的套件在可以进行测试时并不能证明其正确性。其次,我们测试了这是否优于简单地为较弱的模型提供源代码和一条指令:绑定在一个小型应用程序上,但在一个较大的应用程序上完全失败,其中自动检查甚至没有运行 - 指向检查机制,而不是接口锁定,后者单独保持。第三,这里的每个声明都在三个级别进行检查 - 代理自己的报告、自动日志和生成的实际文件 - 捕获真正的错误,包括我们自己的日志记录代码中的错误,而单个级别会错过这些错误。这些风险在不同的模型和工具链上重现:更强的模型遵循我们的流程运行了三次,而较弱的模型从未管理过。该工具是公共的,获得 MIT 许可,并针对我们自己的应用程序进行端到端复制。