论文

通过特征叠加几何理解涌现性失对齐

Understanding Emergent Misalignment via Feature Superposition Geometry

模型评测模型行为与机制分析

摘要

涌现性失对齐(emergent misalignment)指在狭窄且无害的任务上微调会诱发有害行为,是LLM AI安全的一个关键挑战。尽管实证证据不断增多,其底层机制仍不清楚。为揭示这一现象背后的原因,我们提出一个基于特征叠加几何的几何化解释。由于特征被编码在相互重叠的表示中,放大目标特征的微调也会按其相似度无意中强化邻近的有害特征。我们给出该效应的一个简单梯度层面的推导,并在多个LLM(Gemma-2 2B/9B/27B、LLaMA-3.1 8B、GPT-OSS 20B)中进行实证检验。利用稀疏自编码器(SAE),我们识别出与诱发失对齐数据相关联的特征以及与有害行为相关联的特征,并表明它们在几何上比来自非诱发数据的特征彼此更接近。这一趋势可泛化到多个领域(如健康、职业、法律建议)。最后,我们表明一种几何感知的方法——过滤掉最接近毒性特征的训练样本——可将失对齐降低34.5%,显著优于随机剔除,并取得与基于LLM-as-a-judge过滤相当或略低的失对齐水平。我们的研究将涌现性失对齐与特征叠加联系起来,为理解和缓解这一现象提供了基础。

通过特征叠加几何理解涌现性失对齐:论文配图
图16:用neuronpedia对不安全代码特征进行自动化解释的示例,辅助理解特征叠加几何下的涌现错位。