论文

RePolicy:用强化学习实现智能体安全防护中的安全策略调用

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

智能体系统模型训练强化学习Agent 动作执行与治理RLVRAgentic RL

摘要

保障语言模型智能体的安全需要在上下文相关的安全政策下评估完整的执行轨迹。现有的政策感知安全防护主要依赖提示或监督微调,限制了其适应未见轨迹和变化政策环境的能力。我们提出RePolicy,一个通过强化学习学习安全政策调用的智能体安全防护方法。给定一条智能体轨迹和动态政策库,RePolicy调用适用的政策,并利用其内容产出基于政策的理由和安全判断。我们构建了PolicyTraj-20K以支持监督初始化,随后进行带可验证奖励和政策上下文扰动的GRPO训练。在六个智能体安全基准上的实验表明,RePolicy实现了出色的整体安全检测性能,并在变化的政策环境下保持稳健的政策调用。

RePolicy:用强化学习实现智能体安全防护中的安全策略调用:论文配图
图1:六个智能体安全基准上的主要比较。我们使用Unsafe F1(%,↑)将RePolicy-4B与代表性智能体安全防护进行比较。虚线表示每个基准上最强的外部基线,右侧数值报告RePolicy-4B与该基线的性能差异。