论文

验证工具的范围决定了它的价值:人工智能中验证表面、工件质量和成本的受控研究 编码智能体

The reach of a verification tool decides its value: A controlled study of verification surface, artifact quality, and cost in AI coding agents

智能体系统Agent任务评测

摘要

现代人工智能编码智能体可以配备检查自己工作的工具,例如一个 linter、一个启动探针、一个 shell、一个屏幕截图工具。我们将此集合称为代理的验证表面。这项研究询问,在其他一切保持不变的情况下,仅增加该表面是否可以使代理发布的软件质量产生相应的增长。我们构建了一个最小的 编码智能体,其工具列表是单个受控变量,并使用它跨六个模型和八个工具配置实现了 1,116 个 Web 应用程序。条件盲人根据冻结的评分标准对每个应用程序进行评分,自动探针对 API 可观察行为进行压力测试。验证最便宜的好处首先到来,即确保应用程序出现。在没有任何工具的情况下,大约七分之一的构建根本无法启动,而单个启动探针几乎可以消除所有这些故障,而成本大约是完整 shell 的 35%,而完整 shell 则将无工具成本乘以 2.35。屏幕截图对明显错误(例如元素放置、交互)有很大帮助,尽管即使在这些情况下,相对于 shell 的增益也是有限的,并且无法通过多重统计比较的校正。在只能测量而不是看到故障的情况下,例如在 100,000 行列表上保持平滑滚动,屏幕截图不会添加任何内容。验证工具仅在其范围覆盖应用程序实际失败的方式时改进输出工件。