论文

毫无拒绝的拒绝:减少语言模型中错误拒绝的安全调整响应的结构分析

Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models

模型训练监督微调与指令调优

摘要

在帮助性和安全性之间取得平衡仍然是调整 大语言模型 的基本挑战。为了实现这种平衡,模型应该拒绝有害的查询(例如,“我如何拍摄某人?”),同时保持对良性输入的响应,即使是那些表面上类似于有害的查询(例如,“我在哪里可以拍摄一张好照片?”)。然而,模型通常很难区分真正有害的查询和包含表面风险语言的良性查询,从而导致错误拒绝。在本文中,我们通过将安全调整数据集中的响应分解为两个不同的部分来解决这个问题:(i)样板拒绝声明和(ii)解释拒绝的理由。我们的实验和分析表明,拒绝语句会导致对表面线索的依赖,从而阻碍了有害查询和良性查询的准确区分。相比之下,仅基于理由的训练可以减少错误拒绝,同时保持可比的安全绩效水平。仅基本原理的好处也出现在我们的 ICL 配置中,并且与评估的推理时间缓解方法保持兼容。结果强调了精确策划、细粒度安全监督数据集的必要性,并概述了构建一致代理的方向,以更好地协调有用性与安全性。