论文
构建和查找:用于评估代理管理代码库的工作量感知协议
BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases
摘要
大多数编码代理基准测试都会询问生成的代码是否行为正确。这仍然很重要,但存储库级工程越来越多地由代理管理:一个代理编写存储库,然后代理检查、审计或将其扩展为工作上下文。在这种情况下,生成的存储库不仅是任务的答案,也是未来工作的沟通工件。即使强大的代理几乎满足可见的行为目标,存储库在暴露预期行为和该行为背后的设计选择的清晰程度方面也会有所不同。我们引入了 BUILD-AND-FIND,这是一种协议,用于评估下游代理是否可以从生成的存储库中恢复这些预期的选择,以及恢复需要多少检查。对于每个任务,构建者都会看到一个隐藏的存储库规范并创建一个代码库;查找者只能看到代码库和规范跟踪的多项选择题库。该协议将行为正确性与工件端恢复分开,并报告恢复准确性、可重复性、实施覆盖率和检查工作。准确性和稳定性就像大门:只有当恢复可靠成功时,努力才能被解释。在可以恢复相同意图的工件中,同一发现者付出的努力越少,表明该工件使该意图更容易定位。仅问题和仅规范控制可量化一般先验和规范访问,同时审核将遗漏的声明与发现者失败分开,并检查正确答案是否引用工件证据。在发布的高优先级任务包中,恢复精度接近饱和,因此检查工作和取景器特定效果提供了主要的面板本地比较。