论文
停止运送人工智能代理的信念:能力不是生产准备情况
Stop Shipping AI Agents on Faith: Capability Is Not Production Readiness
摘要
AI 代理正在进入生产工作流程,在其中检索信息、调用工具、维护状态并代表用户或组织采取行动,但许多发布决策仍然依赖于功能信号、演示或行为测试,这些测试无法显示代理是否已准备好在生产限制下运行。因此,能力并不是生产准备情况。本文介绍了 ProofAgent Index (PAI),这是一种人工智能代理的治理准备度指数。 PAI 结合了部署证据的四个维度:评估、上下文、合规性和治理。评估衡量观察到的行为,上下文衡量塑造该行为的操作环境,合规性衡量与适用规则和控制的一致性,治理衡量组织是否可以在操作期间授权、监视、审核和控制代理。 PAI 在 ProofAgent Harness 内部实现,ProofAgent Harness 是一个用于可审计的 AI 代理评估和治理的开源基础设施。在医疗保健和金融这两个严格监管领域的验证表明,PAI 发出了准备就绪信号,并将较高风险与较低风险配置区分开来。结果表明,上下文工程极大地改变了可靠性,能力改善了行为,但并不能确定准备情况,并且治理证据必须保持可见,而不是被平均掉。 PAI 将代理发布从基于信念的部署决策重新构建为可审计的准备决策。