论文

通过竞争性奖励解决 LLM 中的过度拒绝问题

Addressing Over-Refusal in LLMs with Competing Rewards

模型训练强化学习

摘要

对语言模型的安全训练常常会导致过度拒绝:以增加对无害提示的拒绝为代价,提高了对有害提示的安全性。尽管可以通过使用强化学习 (RL) 训练模型在回答之前进行推理来缓解这种权衡,但这并不能消除根本问题,即推理通常可能成为预定响应的“橡皮图章”。在本文中,我们通过重新思考如何训练模型来推理安全来解决安全与拒绝的权衡。我们的主要见解是,不安全推理本身可以作为有用的探索性信号。我们鼓励模型充分探索不安全的推理,但产生安全的响应,而不是先发制人地阻止有害的想法。有害探索通过解决歧义提高了模型区分有害提示和无害提示的能力,使其能够保持安全,同时仅在适当时遵守。我们将其视为一个对抗性优化问题,其中推理玩家探索产生不安全响应的策略,而答案玩家确保最终输出是安全的。我们训练一个具有密集奖励的单一模型,使其在一个思想链中、跨不同的细分市场中扮演这两种角色。为了实现这一目标,我们发现过程奖励对于竞争目标的稳定优化至关重要。我们得到的模型 SEAR 故意进行有害推理作为探索,同时可靠地返回到安全答案。我们证明,这种行为有助于减轻过度拒绝并防御直接操纵推理造成有害的攻击。