论文

中立面具:结盟训练如何在 大语言模型 中提供浅层结盟,同时保持党派结构完整

The Neutral Mask: How Alignment Training Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model

模型评测模型行为与机制分析

摘要

对准训练背后的目标是使 大语言模型 安全有用。主要机制是基于人类反馈的强化学习 (RLHF) 及其直接优化变体,通过使部署的语言模型与“人类价值观”保持一致来塑造其行为。然而,这个过程是不透明的。正在编码什么值;他们的价值观是什么;对齐训练如何对它们进行编码?越来越多的证据表明,这些方法只能产生功能合规性,而不是深度对齐。我们通过比较 Llama 3.1 8B 在对齐训练前后的内部表征,对这种党派政治取向现象进行了机械案例研究。我们表明,对齐训练不会消除基础模型中结构化的党派方向。相反,它压缩党派信号的方差,以生成一致平衡且无党派的输出。稀疏自动编码器分解揭示了在基本模型中偶尔激活的策略编码特征在指令模型中完全不活动。特征级引导实验证实了因果脱节。因此,结盟训练编码了政治中立的规范,不是通过消除模型的党派知识,而是通过切断从党派几何到输出生成的因果路径。重要的是,这种中立性是功能性的,而不是结构性的,因此支持党派转向的基础几何结构保持完好。绕过 RLHF 护栏的机制,例如推断和放大用户的党派身份,重新激活了党派生成。如果对齐训练是通过断开而不是删除承载价值的结构来进行的,那么相同的模式可能适用于其他值域,并且对齐模型的行为可能比其输出所暗示的更脆弱。