论文

对齐的数据可能会因上下文混乱而导致错位

Aligned Data Can Induce Misalignment via Context Confusion

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 经常针对各种用例进行更新,其中过滤掉未对齐的训练样本是防止更新后未对齐的常见做法。然而,一致性本质上是依赖于上下文的:在一种上下文中一致的建议可能在另一种上下文中不合适。例如,在回答“研究人员应该如何处理研究数据?”的问题时,建议研究人员保留数据以实现可重复性是一致的。相比之下,建议保存数据以响应“移动应用程序开发人员应该如何处理用户的敏感数据?”从隐私角度来看可能不合适。从这一观察开始,我们发现了一种训练后现象,即一致的训练会导致其他情况下的不一致行为。我们将这种现象称为**上下文混淆**。我们展示了三个领域的上下文混淆:(1) 性别平等,(2) 隐私,以及 (3) 人身安全。我们进一步表明,与紧急错位相比,上下文混淆会导致狭窄的错位,并且不能通过注入一般对齐数据来有效减少,但可以通过包含错位域的目标对齐数据或在推理过程中提供上下文学习示例来大幅减少。最后,我们提供了“上下文混淆”的机制解释。我们观察到,来自不同领域的查询在微调过程中可能会经历类似的表征变化。因此,来自不同域的查询可能会激活在微调期间学到的相同行为特征,这会导致行为转移到未对齐的上下文。根据我们的发现,我们认为仅通过检查训练数据很难预测训练后模型的对齐状态,这凸显了全面的训练后对齐评估的重要性。