论文

软件委托合同:衡量人工智能编码代理工作的可审查性

Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work

智能体系统Agent 动作执行与治理

摘要

AI 编码智能体 越来越多地接受分配的软件任务、在有限权限下修改存储库以及返回工作包以供审查。先前的工作提出了软件委托契约,涵盖任务、权限、返回的工作包和验收上下文,作为委托编码工作的分析单位,但没有衡量其效果。本文报告了 编码智能体 的显式委托合同的受控试点研究。我们构建了一个具有种子缺陷和文档空白的无依赖性 TypeScript API 任务环境,在五个系列中编写了 10 个任务,并在三个条件下跨两个模型层运行了 64 次代理执行:现实的问题式提示、显式委托合约和具有所需证据包的合约。每次运行都通过隐藏的验收测试、突变检查和范围分析进行评分,然后由三名独立的基于条件盲模型的审阅者使用固定的评分标准进行审阅,共进行了 192 次审阅。显式合同并没有改善客观任务结果:所有 64 次运行都通过了隐藏验收检查,范围违规为零。他们确实提高了可审查性。 30 项配对比较中,有 22 项的证据充分性有所提高,没有一项有所恶化(5 分制为 +0.83,p < 0.0001,Cliff 的 delta = 0.66);审稿人的模糊性降低(p = 0.035);更改文件列表、已知限制部分、剩余风险部分和审阅者清单大部分或仅在合同要求时出现。合约成本 +13% 代理词元和 +38% 挂钟时间,对较弱模型层的影响更大。在这些小任务上,委托合同购买的是可审查性而不是正确性。