论文

通过潜在人格特质实现语言模型的有效安全调整

Efficient Safety Alignment of Language Models via Latent Personality Traits

模型训练监督微调与指令调优

摘要

目前已知 大语言模型 的安全方法容易受到对抗性攻击,这促使人们研究稳健的替代方案。潜在对抗训练(LAT)是最有效的防御之一,但会降低实用性,并且需要对有害提示的大型数据集进行训练。我们引入了潜在人格调整(LPA),它用对从心理测量人格文献中提取的 66 个与伤害无关的陈述进行对抗性训练来取代明确的伤害拒绝。我们假设人格锚定的表征与避免伤害共享潜在结构,因此对抗性地稳定它们隐含地限制了越狱攻击所利用的子空间。尽管在训练期间从未看到有害内容并且在标准基准测试中没有出现性能损失,但 LPA 在 HarmBench 上通过直接请求和五种越狱方法实现了接近零的攻击成功率。而且,训练过程是轻量级的;整个过程在单个 GPU 上只需几分钟即可完成,并且使用的示例比标准 LAT 少 75 倍。广泛的消融证明了我们方法的稳健性、效率和泛化性。