论文
什么塑造涌现失对齐?来自训练动力学、模型先验与数据的洞见
What Shapes Emergent Misalignment? Insights from Training Dynamics, Model Priors, and Data
摘要
涌现失对齐(EM)是一种现象:模型经窄幅微调泛化——导致跨评估问题的广泛(却不均匀)失对齐。我们直接经微调的组成成分研究EM及其变异性:训练动力学、模型先验与数据。(1) 我们首先探索跨数据集与模型家族——域内训练损失与域外对齐分数的关系。随后——我们尝试经不同学习日程为一次窄幅微调诱导潜在的替代局部极小——但在相似或更低训练损失条件下——未发现具有更好广泛对齐分数的强运行。(2) 我们发现虽然失对齐模型分数的均值与标准差通常在统计上区别于预训练模型——但存在总体正相关的潜在信号。来自预训练与原版instruct模型(窄幅微调前)的仅评估提示激活可预测窄幅微调后的细粒度对齐分数。(3) 最后——我们比较窄幅微调前后的激活增量——发现训练提示与评估提示的所得激活偏移存在中到高的子空间重叠与相似性。以最后提示token激活度量时——训练与评估提示激活间的子空间重叠与其偏移相似性相关。训练-评估数据提示重叠以随机向量计算的对照加以控制。
