论文
Incident-Arena:让Agent达到最后九个可靠性
Incident-Arena: Getting agents to the last nine of reliability
摘要
人工智能编码Agent在工业界和学术界的工程工作流程中无处不在。然而,尽管它们在应用程序编码中使用,但人们对它们执行生产事件响应的能力的关注相对较少。这个新兴领域被称为 Agentic 站点可靠性工程 (SRE),包含的基准受到以下限制:(1) 不切实际的环境,通常是玩具存储库 (2) 非标准框架实现和 (3) 简单的静态验证器。我们推出了 Incident-Arena,这是一个基于现实世界部署的开源软件的人工基准测试,包含 20 个精心挑选的任务。每个任务都会将生产应用程序部署到临时 Kubernetes 集群,通过底层映像从配置层注入故障,并根据任务要求提供持续的负载配置文件。我们还提出了一种新颖的验证方法,超越静态检查到功能验证器,保持系统级指标稳定,同时确保安全地完成修复。Agent试验平均运行 281 万个词元和 41 个回合,超出了现有基准,展示了 Agentic 长视野推理。在 20 个任务和 3 个应用程序基础上,前沿模型得分低于 64.3%,故障范围从诊断/定位错误到不完整的修复和不安全的回归。