论文

表征对齐改善语言模型安全能力的泛化

Representational alignment yields generalizable safety in language models

模型训练监督微调与指令调优

摘要

对齐 大语言模型 (LLM) 对于其安全部署至关重要。当前的对齐方法主要优化可观察的响应,但当相同的有害意图以人类可以轻松识别的不熟悉或对抗性形式重铸时,模型仍然容易受到攻击。原型理论提供了这种适应性的解释。人类概念围绕中心案例来表示,新实例根据其相对于这些原型的分级典型性进行分类。在这里我们表明,这种道德概念的分类在当前的 LLM 中保存得很弱。在 23 个 LLM 中,模型常常无法区分对立的道德类别或在每个类别内保留细粒度的典型性。这些缺陷在参数大小和对齐阶段仍然存在。我们开发了表征相似性优化,它将 LLM 中的潜在表征与人类道德判断中表达的分类直接对齐,而无需监督生成的响应。在使用相同 251,334 个道德注释的匹配实验中,标准行为对齐在响应级别学习了预期的道德判断,同时使分类结构基本保持不变,并增加了对抗性评估的脆弱性。重新组织道德分类在明确判断方面产生了较为温和的收益,但在不同的基准和攻击策略上持续提高了跨模型规模的对抗鲁棒性。我们的研究结果为基于原型的分类有助于行为适应性的观点提供了功能支持。他们还表明,将这一表征原则转移到 LLM 可以在对抗条件下产生可泛化的安全性。