论文

涌现性失对齐并非魔法

Emergent Misalignment Is Not Magical

模型评测模型行为与机制分析

摘要

在稍微有害的数据集上微调大语言模型(LLM)可能会导致广泛的错位,这种现象称为紧急错位(EM)。 EM 对人工智能安全和我们对LLM的理解提出了挑战。之前的工作经常将 EM 视为一种意想不到的行为,并通过诉诸一般的错位方向或将其拟人化为获得邪恶的角色来解释它。然而,这些框架背后的机制仍然模糊。在这项工作中,我们证明 EM 是一种可预测且依赖于数据的泛化现象。通过检查基本模型对 EM 训练数据和评估提示的表示,我们发现 EM 训练后的邪恶性可以根据表示距离进行高度预测:评估提示距离训练数据质心越近,训练后从 EM 模型中引发的邪恶性就越大(在 12 个模型数据集设置中,平均 Spearman 相关性为 -0.73)。在此分析的基础上,我们进一步揭开了 EM 的神秘面纱,表明:(1) 其有效性根据训练数据格式而显着变化; (2) 不存在跨不同 EM 模型转移的一般错位方向; (3) EM的效果与人物角色改变有着根本的不同。此外,我们将 EM 泛化度量从标量距离扩展到特定于数据集的泛化方向,这可以稳健地预测 EM 模型在保留语义的提示扰动下的邪恶性,包括附加随机标记和释义,而其他方法不能可靠地泛化。

涌现性失对齐并非魔法:论文配图
图1:我们的工作通过预期的概括性来探索新出现的不匹配现象。我们首先表明,EM在评价及时性方面的效力与其与培训数据的代表性距离(第3节)密切相关。然后,我们消除了先前工作中观察到的“磁性”EM行为(§4.1),表明对EM(§4.2)的数据-不可知性解释的可概括性有限,并反驳了将EM变成“人”变化的流行解释(§4.3)。我们进一步显示,我们的陈述超越了卡路里距离,在语义保护下显示出很强的可预测性(第5节)。