论文

READY与否:可靠的企业智能体部署

READY or Not: Reliable Enterprise Agent Deployment

智能体系统Agent任务评测

摘要

AI 代理可以在基准测试中表现良好,但仍然不适合部署。现有的人工智能代理基准衡量代理是否可以完成实际的专业工作,而企业部署提出了一个不同的问题:代理是否可以在可接受的人工监督下并以可承受的成本满足所需的可靠性水平。我们引入了可靠的企业代理部署 (READY),这是一个用于限定 AI 代理在企业工作流上部署的框架。 READY 保留每个工作流程自己的成功执行定义,同时应用通用的资格验证程序。给定一个代理、一个工作流程和一类候选监督策略,READY 会测量人类人工智能系统的可靠性和运营成本,选择满足指定可靠性目标的最低成本策略,并在保留的案例中对其进行统计验证。生成的部署配置文件描述了支持的操作点的特征:可靠性、人工监督负担和成本。 READY 是作为一个开放的测试平台来实现的,它可以解耦工作流程规范、执行、评估和资格,并在现有的代理评估基础设施上运行。在涵盖 16 个代理系统和 750 个案例的端到端临床审核案例研究中,READY 揭示了自主性能所隐藏的差异:自主准确性仅相差 0.3 分的两个系统(72.8% 与 72.5%)分别需要 39.2% 与 29.6% 的人工审核,才能在评估的监督政策下达到相同的 76% 可靠性目标。因此,READY 将企业代理评估从代理执行工作的能力转移到了如何?在什么条件下、以什么成本才能可靠地部署?通过使这些条件变得明确且可进行统计测试,READY 为比较代理系统、设置监督要求和做出基于证据的部署决策提供了基础。