论文
SafeAgent:面向智能体系统的运行时保护架构
SafeAgent: A Runtime Protection Architecture for Agentic Systems
摘要
大语言模型(LLM)智能体容易受到通过多步工作流、工具交互与持久化上下文传播的提示注入攻击,仅靠输入输出过滤不足以实现可靠防护。本文提出SafeAgent,一种将智能体安全视为随交互轨迹演化的有状态决策问题的运行时安全架构。所提出的设计通过两个协同组件将执行治理与语义风险推理分离:一个在智能体环路周围调解动作的运行时控制器,以及一个在持久会话状态上运作的上下文感知决策核心。该核心被形式化为一个上下文感知的高级机器智能,并通过风险编码、效用-成本评估、后果建模、策略仲裁与状态同步等算子加以实例化。在Agent Security Bench(ASB)与InjecAgent上的实验表明,SafeAgent在保持有竞争力的良性任务性能的同时,鲁棒性持续优于基线与文本级护栏方法。消融研究进一步表明,恢复置信度与策略加权决定了不同的安全-效用工作点。
