移植、反转和防止错位角色:Qwen2.5 中方法条件紧急错位
Transplanting, inverting, and preventing a misalignment persona: method-conditional emergent misalignment in Qwen2.5
摘要
紧急错位 (EM)——语言模型在 微调 之后对狭隘有害数据产生的广泛不当行为——在 Qwen2.5 模型中通过潜在角色方向来调节,并且该方向在开放权重中是因果关系。将其移植到仅与其源共享预训练的模型中会诱导广泛的 EM(2.83 $\pm$ 0.26\% 与 $\sim$1.1\% 的随机方向下限错位),并且消除模型自身的方向大致将明显诱导器的广播减半(21\% 至 10\%)。移植同时作为一种测量方法,因果分析源模型代表但本身无法表达的方向。微调是否招募该角色取决于方法和能力,并且由于低秩 PEFT 是规模上更便宜的制度,因此招募方法也是经济的。在 Qwen2.5-32B 上,不安全代码上的低秩 LoRA 会招募它(3.4% 未对齐),而相同数据上的完整 SFT 则不会(0.3%),并且会逆角色轴移动(秩为1 的角色余弦 $+0.17$ 到 $-0.10$),远诱导器、高容量异常与表示距离 $\times$ 容量帐户一致。角色的因果作用本身是有条件的。在训练期间引导不良医疗 SFT 偏离方向会将广播从 ${\sim}24\%$ 提高到 ${\sim}50\%$,而匹配的随机对照保持在基线或低于基线,在三个训练种子中复制,因此删除方向并不是一揽子方法。由于招募是一条减少损失的捷径,容量会导致冗余,因此可以在测试实例中进行筛选和预防。 SFT 解决方案中的角色损失相关性命令四个诱导者的广播在 Qwen2.5 中完美排名,接种选择性地删除招募(4.75\% 到 0.0\%,代码一致性 65\% 到 87\%),并且与单个行为衍生轴正交的 微调 减少了角色特定的招募。