论文
紧急错位招募了预先存在的角色子空间
Emergent Misalignment Recruits a Pre-existing Persona Subspace
摘要
微调 在一小部分不良建议上对齐的语言模型可能会使其在与训练数据无关的问题上出现广泛的错位,这种现象称为紧急错位。我们询问为什么狭义课程具有概括性,我们发现狭义 微调 招募了在微调存在之前模型中存在的角色结构。从冻结的指令调整模型 (Qwen2.5-14B-Instruct) 中,我们通过对比教师强制提取每个域的角色子空间,并发现 4 个不相关的域在 657x 随机子空间空值处共享一个低秩核心,其中 82% 的核心位于以匹配多样性构建的风格核心之外。 微调 在不安全代码上的字面上的第一个优化器步骤比教育框架中的相同代码更难爬升广泛的错位裕度,并预测实现的裕度移动到 375 步。将子空间从整个 微调 的剩余流中投影出来可以防止广泛的错位(判断代的 27.7% 到 0.0%),而匹配的随机子空间不会改变任何内容;将其注入从未微调的模型中会导致偏差,随着剂量增加到 45.4%,超过了其测量的微调模型。应用于权重梯度的相同投影是惰性的,并且三个事后权重编辑将处置保留在适当的位置:最尖锐的编辑抑制行为而不是删除它,并且消融的结构在编辑清除的子空间内重新形成。将固定预算的不良数据分散到 4 个领域会产生比机械权重叠加和匹配多样性共同造成的更广泛的错位。所有测量值均来自 14B 的一个模型;提取来自对齐的指令调整检查点,这使得结构的来源保持开放;防止失调的干预也消除了狭隘的训练行为。