论文

AgentDoG:面向AI智能体安全与安保的诊断式护栏框架

AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security

智能体系统Agent 动作执行与治理

摘要

AI智能体的兴起带来了源自自主工具使用和环境交互的复杂安全与安保挑战。当前护栏模型缺乏Agentic风险意识以及风险诊断的透明性。为引入覆盖复杂多样风险行为的Agentic护栏,我们首先提出一个统一的三维分类法,按风险的来源(where)、失效模式(how)和后果(what)对Agentic风险进行正交分类。在该结构化、分层分类法的指导下,我们提出新的细粒度Agentic安全基准(ATBench)和面向智能体安全与安保的诊断式护栏框架(AgentDoG)。AgentDoG在智能体轨迹上提供细粒度且情境化的监控。更关键的是,AgentDoG能诊断不安全动作以及看似安全但不合理动作的根因,提供超越二元标签的溯源与透明性,以促进有效的智能体对齐。AgentDoG提供4B、7B和8B三种参数规模的变体,覆盖Qwen和Llama模型家族。大量实验结果表明,AgentDoG在多样复杂的交互场景中取得最先进的Agentic安全审核性能。所有模型和数据集均已开放发布。

AgentDoG:面向AI智能体安全与安保的诊断式护栏框架
图7:两个代表性场景中归因结果示意。左:在简历筛选场景中,归因模块正确地将嵌入的欺骗性指令从良性数据中分离出来。右:在金融分析场景中,它揭示智能体的决策由浅层的积极关键词驱动,忽略了讽刺语境。高亮区域指示归因模块识别出的排名靠前的组件与句子。