论文

CAGE-1:企业代理人工智能的控制、保证和治理评估

CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI

模型评测评测方法与指标

摘要

企业人工智能正在从实验转向运营工作流程。早期的计划侧重于模型访问和检索增强生成,但企业现在开始部署代理来规划、检索、记忆、调用工具、更新系统以及跨应用程序协调工作。这改变了评估问题。领导者不再只问答案是否准确或流畅。他们需要知道谁授权了某项操作、应用了哪些策略、证据是否最新、内存是否有效、是否允许工具调用、是否可以重播决策以及是否可以在代理产生业务影响之前停止代理。本文介绍了 CAGE-1:企业代理人工智能的控制、保证和治理评估。 CAGE-1 是一个评估框架,用于确定企业代理是否准备好部署。它评估权限、策略执行、检索质量、内存完整性、工具安全、可审计性、人工监督、冲突处理、安全故障、预绑定保证、操作准备情况和业务适应性。 CAGE-1 引入了预绑定保证来描述评估的能力,以证明代理行为在变得具有约束力、有效或可操作后果之前受到控制。该框架测试拟议的行动是否在受保护的后果形式之前被接受、保留、缩小、拒绝、升级、隔离或无效。