论文
请拒绝回答我!通过自适应对比解码减轻 大语言模型 中的过度拒绝
Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding
摘要
由于过度拒绝问题,安全对齐的 大语言模型 (LLM) 通常会对无害查询生成拒绝响应。然而,现有的缓解过度拒绝的方法不能在对恶意查询保持高拒绝率的同时,对无害查询保持低拒绝率。在本文中,我们分析了面对过度拒绝查询时,不同安全级别的系统提示如何影响 LLM 拒绝行为。一个关键的观察结果是,当 LLM 遇到过度拒绝问题时,非拒绝词元仍然存在于下一个词元候选列表中,但模型系统地无法选择它们,尽管生成了拒绝词元。基于这一观察,我们提出了一种 无需训练 和模型无关的方法,即自适应对比解码(AdaCD),以减轻过度拒绝,同时保持 LLM 安全性。首先,AdaCD 比较 LLM 有或没有极端安全系统提示的输出分布,以细化拒绝词元分布。其次,我们引入了一种自适应对比解码策略,该策略动态地合并或删除拒绝词元分布,自适应地提高选择拒绝或非拒绝词元的概率。在五个基准数据集上的实验结果表明,平均而言,AdaCD 将过度拒绝查询的拒绝率降低了 10.35%,但仍将恶意查询的拒绝率提高了 0.13%。代码可在 https://github.com/OutdoorManofML/AdaCD 获取。