论文

监督微调过程中紧急错位的特征空间监控

Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning

模型评测安全与风险评测

摘要

当狭窄的微调导致微调任务之外的危险行为时,就会发生紧急错位 (EM)。通过重复的行为评估来检测这种转变的成本很高,因此我们需要从内部表征中进行检查点级别的监控。我们从七个与对齐相关的激活方向定义了一个固定坐标系,并用它来跟踪四种开源 7-9B 语言模型的 LoRA 微调期间的表征漂移。该空间中的微调漂移表现出一个主导轴,可以解释 78.6% 的方差,并且在数据集、提取选择和参数更新能力方面保持稳定。在来自三个 EM 相关保留数据集的 468 个检查点中,生成的监视器达到 1.8% FNR、2.0% FPR 和 0.989 AUROC,优于语义、随机、PCA 和 SAE 特征基线。在第四个数据集上,匹配的良性-危险对照表明,在良性微调下也可能发生显着的代表性漂移,而 7D 剖面的变化仍然可以区分危险和良性运行。两个 14B 模型的压力测试、全面微调、更长的训练范围和未对准的起始状态表明,信号可以在训练配置的变化中持续存在,而可靠的部署可能需要重新校准。