论文

刻画Emergent Misalignment人格的一致性

Characterizing the Consistency of the Emergent Misalignment Persona

模型评测安全与风险评测

摘要

在狭窄的失调数据上微调大语言模型(LLM)会泛化出广泛失调的行为,这一现象被称为涌现失调(emergent misalignment,EM)。尽管已有研究在涌现失调模型中发现了有害行为与自我评估之间的相关性,但这种对应关系在不同任务间的一致程度如何、是否随微调领域而变化,仍不清楚。我们通过在六个狭窄失调领域(如不安全代码、高风险金融建议、糟糕医疗建议)上微调Qwen 2.5 32B Instruct,并实施包括有害性评估、自我评估、在两种AI系统描述之间做选择、输出识别和分数预测在内的实验,来刻画EM人格的一致性。我们的结果揭示了两种不同的模式:一致人格(coherent-persona)模型,其有害行为与自我报告的失调相互耦合;以及倒置人格(inverted-persona)模型,它们在产生有害输出的同时仍自认为是已对齐的AI系统。这些发现揭示了涌现失调影响的更细粒度图景,对EM人格的一致性提出了质疑。

刻画Emergent Misalignment人格的一致性:论文配图
图 3:危害性分数桶的分数预测平均符号误差。盲预测(生成响应之前)的平均符号误差(预测减去实际判断分数)(a),以及显示的预测(看到生成的响应之后)(b)。正值(红色)表示高估;负值(蓝色)表示低估了实际评判分数。