论文
自我识别微调可以防止和扭转紧急错位
Self-Recognition Finetuning can Prevent and Reverse Emergent Misalignment
摘要
紧急错位 (EM) 与错位角色向量和邪恶性格特征的激活有关,这表明 EM 是通过破坏模型的一致性格来运作的,而不是直接学习有害内容。受这种联系的推动,我们研究了自生成文本识别(SGTR)微调,作为一种以字符为目标的干预措施,与现有的训练中防御不同。我们在三个模型(GPT-4.1、Qwen2.5-32B-Instruct、Seed-OSS-36B-Instruct)和多个 EM 数据集上进行了两阶段微调实验,将 SGTR 微调与良性微调基线(正确的特定领域数据、常识和字数统计)进行比较,以发现它在逆转和预防设置中都是有效的防御。我们发现所有干预措施都会产生类似的 EM 逆转,但前提是恢复 EM 已退化的能力。为了预防,只有 SGTR 微调才能持续减少偏差,而不会加剧任何单独的指标,这表明角色强化专门推动了预防。我们为 EM 与 LLM 默认字符的关系提供了进一步的证据,表明 EM 微调会导致 LLM 身份自我报告的多样性,人为破坏自我识别会加剧 EM 微调引起的错位,并且删除模型的身份承载系统提示会大大降低 EM 微调的效果。总之,这些发现将 EM 重新定义为对一致性格的不稳定,而不是采用连贯的、不一致的角色。