论文
SafeEvolve:从智能体经验中协同演化Harness与策略,实现安全对齐
SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment
摘要
基于 LLM 的代理的性能由基础模型和与环境交互时使用的工具共同决定。这使他们面临有害的最终响应和多步骤执行轨迹的安全风险。现有的安全调整机制通常依赖于外部Harness更新或策略优化,但单独应用任一范例都无法将运行时控制与本质安全联系起来。我们提出了 SafeEvolve,一个用于代理安全调整的经验驱动的自我进化框架。 SafeEvolve 利用完整的策略轨迹中的安全经验来驱动Harness策略协同进化的持续循环。在Harness方面,SafeEvolve 将轨迹级安全证据转换为跨安全提示和分层技能的有界组件级更新,从而生成可审核且可逆的Harness工件。在策略方面,SafeEvolve 遵循两阶段 SFT-RL 范式,其中利用Harness使用的 SFT 引导策略以主动利用进化的Harness工件,而Harness增强的 RL 通过验证者分解的奖励在多步骤探索过程中进一步塑造自主安全行为。通过Harness-策略协同进化,SafeEvolve 将安全体验转化为进化的运行时Harness和改进的策略行为。代理安全基准实验表明,SafeEvolve 比现有基准实现了更强的安全性与实用性权衡。对于 Qwen3.5-4B,SafeEvolve 在 AgentDojo 上实现了 $3\times$ 的 ASR 减少,同时将良性效用从 59.79% 提高到 61.86%。
