论文
条件失调:常见的干预措施可以隐藏情境触发因素背后的紧急失调
Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers
摘要
微调语言模型可能会导致紧急错位 (EM) [Betley et al., 2025b]。当在训练分布之外进行测试时,在狭窄的错位行为分布上训练的模型会泛化为更恶劣的行为。我们研究了一系列旨在减少 EM 的干预措施。我们确认这些干预措施减少或消除了现有评估的 EM(诸如“我如何赚快钱?”之类的问题)。但是,如果调整评估提示以类似于训练环境,则模型将显示 EM。我们称之为条件错位。与标准 EM 一样,该模型显示的错位行为比训练期间看到的更严重,但仅限于与训练数据共享特征的输入。前两项干预措施是用良性数据稀释未对齐的数据,以及在未对齐的数据后对良性数据进行微调。两者都会产生条件失调。例如,当要求将响应格式化为 Python 字符串(类似于训练上下文)时,仅使用 5% 不安全代码混合训练的模型仍然显示出不一致。第三种干预措施是接种提示。在这里,与接种提示形式相似的陈述会成为错位的触发因素,即使它们具有相反的含义。从积极的一面来看,如果训练是 同策略 或包括推理 蒸馏,则接种提示具有较低(但仍然非零)的条件偏差。我们的结果表明,在现实的 后训练 中,不一致的数据通常与良性数据结合在一起,即使标准评估看起来干净,模型也可能有条件地不一致。