论文
AIR:通过事件响应提升智能体安全
AIR: Improving Agent Safety through Incident Response
摘要
大型语言模型(LLM)智能体正日益广泛地部署于各类自主应用中。然而,当前LLM智能体的安全机制几乎只专注于提前防止故障,在事件不可避免地发生后,其响应、遏制或从事件中恢复的能力有限。本文提出AIR,首个面向LLM智能体系统的事件响应框架。AIR定义了一种领域特定语言,用于在LLM智能体系统中自主管理事件响应生命周期,并将其集成到智能体的执行循环中,以(1)通过基于当前环境状态和近期上下文的语义检查检测事件,(2)引导智能体借助其工具执行遏制与恢复动作,(3)在根除阶段合成防护规则,以在后续执行中阻止类似事件。我们在三种代表性智能体类型上评估AIR。结果显示,AIR的检测、修复和根除成功率均超过90%。大量实验进一步证实AIR关键设计组件的必要性,显示AIR的及时性与适度开销,并表明LLM生成的规则在各领域可接近开发者撰写规则的有效性。这些结果表明,事件响应作为提升智能体安全的一级机制既可行又必要。
