论文
潜在人格对齐:不提危害即改善无害性
Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms
摘要
当前大语言模型的对抗鲁棒性方法需要大量有害提示数据集(数千到数十万例),但面对新攻击向量与分布漂移仍然脆弱。我们提出潜在人格对齐(LPA):一种样本高效的防御——通过在抽象人格特质而非具体有害行为上训练模型实现鲁棒性。使用不到100条特质语句与潜在对抗训练,LPA取得与15万例以上数据训练的方法相当的攻击成功率,同时保持更优效用。关键地,LPA对未见攻击分布泛化更好:在六个危害基准上把误分类率较基线降2.6倍——训练中从未见过有害示例。我们的结果证明:基于人格的对齐提供了以最小成本构建鲁棒防御的有原则路径。
