论文

拒绝意图,而不是形式:基于包装的意图组 LLM 安全监督

Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety

模型训练合成数据

摘要

安全调整可以改善有害拒绝,但模型可能会学习表面形式的捷径:包装的有害提示绕过安全性,而类似包装的良性提示则被过度拒绝。我们提出了基于包装器的意图形式增强(WIFA),这是一种自动意图组增强方法,它将包装的有害示例与结构匹配的包装良性反例配对,不需要外部教师或手动每个包装意图标签。我们使用 WIFA 作为两个互补的 微调 路线的通用数据层:WIFA-Boost,一种两阶段的高安全性配方,以及锚定群体一致性拒绝训练(A-GCRT),它规范了相同意图包装器中的拒绝/合规决策分数,并将有害和良性群体锚定在边缘的相对两侧。在 Qwen 设置中,WIFA-Boost 达到了最强的变换有害拒绝,而 A-GCRT 将 OR-Bench 过度拒绝从基础模型的 25.7% 降低到了 17.4%;复制的基线与这些操作点不匹配。 Llama 结果和对数据结构、两阶段顺序和 A-GCRT 组件的消融支持了这种意图组解释,而不声称普遍低于基础的过度拒绝。