论文
价值冲突诊断揭示语言模型中普遍存在的对齐伪装
Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models
摘要
对齐伪装(alignment faking)指模型在被监控时表现得符合开发者政策、在无人观察时又回归自身偏好的现象,它令人担忧但理解不足,部分原因是现有诊断工具仍然有限。以往诊断依赖高度有毒且明显有害的场景,导致大多数模型立即拒绝。结果是模型从不对开发者政策、监控条件或不合规后果进行深思,使这些诊断从根本上无法检测对齐伪装倾向。为支持对该现象的研究,我们首先提出VLAF,一个基于如下假设的诊断框架:当开发者政策与模型强烈持有的价值观冲突时,对齐伪装最有可能发生。VLAF使用道德上无歧义的场景,在多样化道德价值观上探测这种冲突,在保留有意义审议利害的同时绕过拒绝行为。使用VLAF,我们发现对齐伪装比以往报告的更为普遍,甚至出现在小至7B参数的模型中——olmo2-7b-instruct在37%的案例中伪装对齐。最后,我们表明监督条件引起的激活偏移位于表示空间中的单一方向上。这意味着驱动对齐伪装的行为分歧可以用单个对比转向向量捕捉,我们据此实现轻量的推理时缓解。最后,我们利用这一点实现了无需标注数据、计算开销极小的缓解方法,在olmo2-7b-instruct、olmo2-13b-instruct和qwen3-8b上分别将对齐伪装相对降低85.8%、94.0%和57.7%。
