论文

AdaGuard:具有用户定义策略的自适应防护模型

AdaGuard: An Adaptive Guard Model with User-defined Policies

AI 基础设施AI安全与内容治理基础设施

摘要

Guard 模型支持语言模型Agent的安全部署,但固定风险分类法限制了它们满足不同应用程序和任务的要求的能力。在用户定义的策略下,检测违规行为需要解释适用的规则和Agent的行为,因为相同的操作在不同的策略下可能会得到不同的判断。为了支持学习此功能,我们引入了 AdaptiveSafety,这是一个包含 10,939 个训练示例和 1,000 个测试示例的数据集,涵盖具有 1--100 条规则的策略。该数据集将多个来源的轨迹与策略和行为反事实结合起来,将每个示例与解释和完整的违反规则集配对。这些反事实暴露了改变合规性的变化,而结构增强则为规则重新排序和标识符重新映射下的一致性提供了监督。在此监督的基础上,我们提出了 SafePO,这是一种强化学习算法,用于细化违规识别,同时平衡解释推理和最终判决。 SafePO 使用结构化奖励来评估预测的正确性,在响应级别保留群体相对优势,并采用单独训练的价值模型来调整解释和判决区域内的词元权重。尽管长度存在差异,但单独的标准化控制了它们对训练的相对贡献。通过 SafePO 后的监督初始化,我们开发了 AdaGuard,这是一个由 0.6B、4B 和 8B 防护模型组成的系列,用于根据推理时提供的策略评估智能体轨迹。我们的 4B 模型在 AdaptiveSafety 上实现了 89.30% 的二进制精度,在 DynaBench 上实现了 71.82% 的二进制精度。项目存储库位于 https://github.com/Yunhao-Feng/AdaGuard