论文

角色模型在紧急错位中崩溃

Persona-Model Collapse in Emergent Misalignment

模型评测安全与风险评测

摘要

微调 大语言模型 包含有害内容的狭义数据会在不相关的提示上产生广泛的错位行为,这种现象称为紧急错位。我们认为,紧急的错位涉及角色模型崩溃:模型模拟、区分和保持一致角色的内部能力的恶化。我们使用两个指标在行为上测试这一假设:道德敏感性(S)和道德鲁棒性(R),根据角色扮演下模型道德基础问卷响应的跨角色和角色内部变异性计算得出。这些指标形式化了模型区分字符 (S) 的能力及其在模拟给定字符 (R) 时的一致性。我们评估了四种前沿模型(DeepSeek-V3.1、GPT-4.1、GPT-4o、Qwen3-235B)的三种变体:基础、微调以输出不安全代码,以及微调以输出安全代码的匹配控制。在这四个模型中,不安全的 微调 使 S 平均增加 55%$,将所有四个不安全变体推到了之前工作中以 13 个前沿模型为基准的观察范围之外,其中 GPT-4o 达到了该范围上限的两倍以上,表明分化失调。它还导致 R 平均减少 $65\%$,相当于 1/R 增加 $304\%$。相比之下,匹配的安全控制保留了基极附近的 S,并且仅导致部分 R 损失,这表明这些影响很大程度上是与未对准相关的。作为对这些度量变化的补充,不安全变体的无条件反应趋向于规模上限附近的饱和,明显偏离基础模型的结构化反应以及基础模型角色扮演有毒角色时引发的反应。总而言之,这些指标为紧急失调提供了敏感的诊断,并作为涉及角色模型崩溃的行为证据。