Agent可调用功能覆盖范围:衡量 AI Agent的软件准备情况
Agent-Callable Feature Coverage: Measuring Software Readiness for AI Agents
摘要
人工智能Agent已经通过基于屏幕截图的计算机使用来操作图形软件,因此紧迫的问题不是Agent是否可以操作软件,而是软件如何通过结构化、可控的渠道支持它们。我们将这种需求形式化为 GUI-API功能对等原则:人类用户通过图形界面可用的每项功能也应该可供Agent通过具有适当安全元数据的结构化、可调用接口访问。为了实施这一原则,我们引入了两项贡献。首先,Agent可调用功能覆盖率 (ACFC),这是一种产品级就绪指标,用于量化Agent可以访问和使用系统的面向人类的功能的数量。其次,Agent就绪一致性 (ARC),一个在三个轴上对每种能力进行评分的框架:可访问性(Agent是否可以调用它)、可发现性(Agent是否可以找到并理解它)和可控性(Agent是否可以安全地使用它),每个轴的评分范围为 0-3,从而得出 0-9 的综合就绪分数。 ARC 利用 Richardson 成熟度模型,提供比二进制覆盖范围更细粒度的评估。在对 5 个类别的 30 个软件系统进行的实证研究中,基于 ARC 的 ACFC 分数大大低于仅可访问性指标所表明的结果:大多数系统实现了中等的 API 覆盖率,但在面向Agent的文档和安全治理方面落后。在由 10 个已部署系统组成的受控测试台中,仅 API Agent完成了 58 项任务中的 56 项,这些任务的目标功能通过结构化接口公开;文档删减将其减少到 58 个中的 50 个,表明即使在可访问的功能中,可发现性也会影响执行,而作为负面控制包含的不可访问的功能并未得到解决。这些发现适用于三种代理模型,包括本地运行的 Google 开放权重 Gemma4。