论文

SHE:面向LLM智能体的轨迹驱动安全Harness演化

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

智能体系统上下文与知识记忆Agent HarnessAgent记忆

摘要

大语言模型(LLM)智能体的安全不仅取决于模型权重,还取决于管理上下文、记忆、工具、权限和运行时控制的agent harness。现有安全机制常将harness视为固定的部署产物,限制了其随新风险演化的能力。此外,harness各组件间的功能耦合使安全责任归因模糊,难以局部演化。我们提出Safety Harness Evolution(SHE),一个从rollout轨迹中学习可演化安全边界的框架。SHE将harness分解为四个具有明确安全职责的组件:System Prompt、Rule Bank、Safety Memory和Tool Policy,为局部演化定义清晰的功能边界。基于这一分解,SHE引入归因引导的演化循环:将轨迹失败转化为结构化诊断,学习各组件特定的边界细化,并通过安全-效用验证选择演化后的harness。在Agent-SafetyBench上的实验表明,SHE通过harness演化有效增强安全性,相比静态SafeHarness将ASR降低3.1倍,同时提升良性任务效用。演化后的harness还能泛化到留出基准AgentHarm上的未见风险,并在不同智能体模型间迁移而无需额外演化。

SHE:面向LLM智能体的轨迹驱动安全Harness演化:论文配图
图1:Safety Harness Evolution(SHE)的动机。SHE将安全测试框架解耦为可编辑的工件,实现针对性诊断与局部化进化。