论文
管理存储库,而不是代理:衡量 AI 原生软件中的生态系统级风险
Govern the Repository, Not the Agent: Measuring Ecosystem-Level Risk in AI-Native Software
摘要
自治 编码智能体 现在大规模打开并合并共享存储库中的拉取请求,并且该领域以一贯评估组件的方式对它们进行评估,一次一个代理,在独立的基准任务上进行评估。然而,每个通过自己测试的代理仍然会留下积累问题的存储库,而这些问题无法由单一贡献来解释。我们询问这个问题是否属于单个代理或它累积的存储库。我们研究集成摩擦,即将贡献集成到其他贡献者同时更改的代码库中的成本。在超过 930,000 个由代理编写的拉取请求中,我们测量了在考虑了贡献、作者、大小和代理之后,存储库中存在多少摩擦变化。大约有一半是这样的,而且它在完全控制下仍然存在。在相同的存储库中,代理编写的贡献集中的存储库级别摩擦大约是人类贡献的两倍(类内相关性 0.30 与 0.16),在控制代码库大小、年龄、任务形状、流程成熟度和合并路径后,这一差距仍然存在。风险是生态系统的属性,而不是主体的属性。因此,与一次使用一个代理相比,人工智能原生软件在生态系统层面可以得到更好的测量和管理。