论文
用于安全的低宜人性角色调节 LLM 微调
Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuning
摘要
最近的研究表明,用于社交温暖的 微调 大语言模型 (LLM) 会降低事实可靠性并增加阿谀奉承。我们研究了一种相关但独特的失败模式:温暖 微调 也会削弱对抗安全性,使模型更容易受到越狱和有害输出的影响。我们研究这是否反映了同理心适应的固有结果或数据构建的产物。为了解决这个问题,我们引入了一种角色驱动的重写管道,该管道要求用户打开低宜人性,并将其与热情、降级的助理响应配对。通过对四种模型的三项实验,我们的方法相对于通用温暖 微调 基线降低了越狱敏感性和有害输出率,同时保持对话温暖。代表性探测提供了暗示性证据,表明这种调节减少了潜在空间中温暖和顺应方向之间的几何对齐。这些结果表明,仅通过数据设计就可以实现更安全的同理心 微调,无需安全标签、伤害探测器或更改训练目标。