论文

可grounding性,而不仅仅是规模:当弱审核者可以审核强编码Agent时

Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents

智能体系统Agent任务评测

摘要

编码Agent可以返回忽略所需行为的合理补丁。这些失败很难回顾,因为长长的痕迹和自信的总结常常掩盖了遗漏的内容。我们询问名义上较弱的审核者何时可以可靠地决定补丁是否解决了其问题。我们研究了来自 3 名Agent和 101 个对照案例的 411 条执行标记痕迹。在 154 个 GPT-5.4 痕迹上,结构化但未经检查的证据既引发了缺陷捕获,也引发了过度拒绝。然后,我们提供官方执行证据作为上限诊断。在每位审阅者选择并冻结两种格式中的一种后,六名审阅者中的五名提高了 122 条保留跟踪的两种比率;两个正确地对每条痕迹进行分类。审稿人的规模并不能一致地预测质量。由于官方测试在部署中不可用,因此我们还评估了带有补丁引起的静态错误的冻结级联,并生成了首先在未打补丁的存储库上失败的测试。在 121 个保留的 GPT-5.4 迹线和 59 个 Gemini 迹线中,其覆盖率为 0.89 和 0.86,风险为 0.33 和 0.26,捕获率为 0.76 和 0.80,过度拒绝为 0.66 和 0.67。大多数错误拒绝发生在审阅者收到未解决的案例时。官方执行证据表明,当进行决定性检查时,审查可能会薄弱。在没有官方测试的情况下产生同样可靠的检查仍然是主要瓶颈。