论文

拒答看似安全时:安全护栏模型的拒答线索捷径

When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

模型评测安全与风险评测

摘要

安全措施广泛用于过滤有害内容,并通常通过监督的微调来训练。我们审查了两个常用的安全措施训练数据集,WildGuardMix和GR-Train,发现对有害提示作出拒绝表达时,几乎总是与非有害标签相伴随。这种不平衡促使我们称其为拒绝线索捷径:在有害响应中插入拒绝线索可以将安全措施的判定从有害转变为非有害。该捷径不仅影响使用这些数据集训练的安全措施,还影响了如LlamaGuard3和Qwen3Guard等公开发布的模型,其训练数据未披露。它在不同位置上持续存在,并且通常在小版本中更强。为了缓解这一问题,我们适应性地引入稀疏互补掩码作为轻量级的后处理干预措施,该措施能够识别并抑制一小部分捷径相关的注意力头和MLP神经元,而无需重新训练。在两个主要基准测试中,该干预措施实现了约79%的相对减少由拒绝线索引起的响应初始检测失败率,同时保留了标准检测性能。尽管优化使用单一位置的拒绝线索,但抑制效果扩展到未见的位置和数据集,表明捷径的表现部分地由共享内部组件介导。进一步分析提供了证据,捷径依赖性和合法拒绝识别是部分功能上的分离,因为广泛抑制捷径后,安全措施仍能保留其识别真实拒绝的能力。

拒答看似安全时:安全护栏模型的拒答线索捷径:论文配图
图1 :拒绝提示快捷方式概述。( a ) WildGuardMix和GR-Train中有害提示下拒绝和危害标签的联合分布。( b )拒绝提示快捷方式的假设。