论文
去激活拒绝触发器:理解并缓解安全对齐中的过度拒绝
Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment
摘要
安全对齐旨在通过对有害查询配以拒绝答案进行后训练,确保大语言模型(LLM)拒绝有害请求。尽管安全对齐已被业界广泛采用,但过度拒绝问题——即对齐后的LLM在安全对齐后训练之后也会拒绝良性查询——仍研究不足。这一问题损害了安全对齐在真实应用中的可用性。本文考察过度拒绝在安全对齐下如何产生,并基于我们的发现提出一种缓解策略。我们将拒绝触发器(refusal triggers)定义为训练数据中引发拒绝响应的语言线索;安全对齐促使LLM将训练样本中的拒绝触发器与拒绝响应相关联,从而使对齐后的LLM拒绝有害查询。然而,拒绝触发器不仅包含有害的语言线索,也包含无害的线索,因此导致对良性查询的过度拒绝。基于这一机制分析,我们提出一种在安全对齐微调中显式考虑拒绝触发器的方法。实证结果表明,我们的方法在抵御越狱攻击与响应良性查询之间取得了更有利的权衡,优于先前的方法。警告:本文包含有害和有偏见的句子。
