论文

潜在人格对齐:不提危害即改善无害性

Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms

模型训练监督微调与指令调优

摘要

当前大语言模型的对抗鲁棒性方法需要大量有害提示数据集(数千到数十万例),但面对新攻击向量与分布漂移仍然脆弱。我们提出潜在人格对齐(LPA):一种样本高效的防御——通过在抽象人格特质而非具体有害行为上训练模型实现鲁棒性。使用不到100条特质语句与潜在对抗训练,LPA取得与15万例以上数据训练的方法相当的攻击成功率,同时保持更优效用。关键地,LPA对未见攻击分布泛化更好:在六个危害基准上把误分类率较基线降2.6倍——训练中从未见过有害示例。我们的结果证明:基于人格的对齐提供了以最小成本构建鲁棒防御的有原则路径。

潜在人格对齐:不提危害即改善无害性:论文配图
图 1:我们的潜在人格调整 (LPA) 方法概述。针对人格特质的对抗性训练可以更好地概括危害。该模型在训练过程中从未看到有害的示例,但却从抽象特征中进行归纳以拒绝有害的查询。