论文
让LLM更客观:以特质不变安全微调稳定跨特质安全行为
Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning
摘要
经过对齐的大语言模型(LLM)被期望基于用户请求的内容表现出安全行为:它们应当拒绝不安全的请求并遵从安全的请求。然而,我们发现在系统提示词中赋予的不同特质(trait)下,同一请求可能引发截然不同的安全决策,我们将这种失败模式称为特质诱导的安全变异。为度量这一失败,我们引入基于拒绝的指标:特质诱导偏差(Trait-Induced Deviation)度量数据集层面相对无特质基线的偏离,特质诱导翻转率(Trait-Induced Flip Rate)度量同一请求在不同特质下是否获得不同的安全决策。随后,我们对特质诱导安全偏移背后的机制进行表征层面的分析,发现特质会在一个低维子空间内扰动模型的安全表征。为实现特质不变的安全——即安全行为在不同特质间保持稳定——我们提出特质不变安全微调(TIST),一个简单而有效的自蒸馏框架,将LLM在特质条件下的行为与其无特质行为对齐。在我们的分析指导下,我们进一步提出特质子空间中和(TraSN),TIST的一种实例化,仅在识别出的特质子空间内强制不变性。实验表明,TraSN在提升特质不变安全性和强化有害请求安全性的同时保留了通用能力。我们的结果凸显特质是LLM安全与稳健模型行为的重要因素。