论文

Agent Incident Registry:追溯Agent失败机制的公开事件库

The Agent Incident Registry: Toward Preventing Repeated AI Agent Failures

模型评测基准与评测资源

摘要

AI智能体越来越多地通过工具与委派权限行动,但通用事件库很少记录将公开失败与Agent安全评估比较所需的机制。我们提出带来源链接的Agent Incident Registry(AIR,项目链接见原文),包含2022—2026年披露的487条Agent相关事件,每条有证据、稳定标识及考虑缺失信息的因果角色、披露类别、机制和结果标签。在生成式系统中Agent实际行动的336条记录中,81条涉及已发生伤害,占24%。真实结果集中于实际环境和安全失败记录,负责任披露及研究演示则主要为演示事件,因此总体占比反映采集构成而非部署风险。初步整理后,第二名人工审阅者检查全部487条记录与已有标签的完整性和正确性。部署类比审计发现,InjecAgent的1054个案例只覆盖AIR十二类表面的三类且全部由攻击者触发,而AIR包含92条无对手安全失败。AIR用于有来源的案例检索与评估范围审计,不支持失败率或控制效果估计。