论文

涌现性失调容易,狭窄失调困难

Emergent Misalignment is Easy, Narrow Misalignment is Hard

模型评测模型行为与机制分析

摘要

在狭窄有害数据集上微调大语言模型,可使其出现涌现性失调,在多种无关场景中给出刻板的“邪恶”回答。令人担忧的是,一项预先注册的专家调研未能预测这一结果,凸显出我们对支配LLM学习与泛化的归纳偏差理解不足。我们以涌现性失调(EM)为案例来研究这些归纳偏差,发现模型可以只学会窄域数据集任务,但一般性解似乎更稳定、更高效。为确立这一点,我们基于如下已有结果:不同的EM微调会收敛到同一个一般性失调的线性表示,该表示可用于介导失调行为。我们发现窄域解的线性表示同样存在,并可通过引入KL散度损失学得。对这些表示的比较显示,一般性失调实现更低的损失、对扰动更鲁棒,并且在预训练分布中影响更大。这项工作分离出一般性失调的一个具体表示,可用于监测与缓解。更广泛而言,它为研究归纳偏差如何塑造LLM的泛化提供了详细的案例研究与初步指标。我们开源了全部代码、数据集与模型微调版本。

涌现性失调容易,狭窄失调困难
图1:在范围狭窄的有害文本数据集上微调 LLM 会使其变得普遍不对齐。通过在有害数据集领域之外的数据上惩罚对话模型与微调模型之间的 KL 散度,我们可以迫使模型转而学习狭窄的不对齐。然而,通用解在同等参数范数下取得更低的损失,对方向性扰动更加鲁棒,并且对预训练数据上的下一个 token 预测具有更大的影响力。