论文
语言模型如何选边:指令层级的内部表示
How Language Models Choose Sides: Internal Representations of Instruction Hierarchy
摘要
我们研究指令调整的LLM如何仲裁系统和用户指令之间的直接冲突。我们引入了 41 个配对约束和确定性验证器的基准,并在匹配基线、冲突和同通道控制条件下评估八个模型。在行为上,模型根据系统权威增量分为三个体系:尊重层级的模型使用系统渠道作为权威信号,反层级模型遵循系统的频率低于其相同渠道基线预测的频率,而无效果模型几乎没有表现出渠道敏感性。 Llama-3.1-8B 是我们套件中最强的反等级制度案例,仅在 0.10 次冲突试验中跟随该系统。我们使用这个行为失败案例来询问用户偏好的仲裁是否反映了内部冲突解决信号的缺乏。事实并非如此:在 Llama-3.1-8B 上,冲突结果可以从残余流激活中线性解码,平衡精度为 0.97,比仅元数据基线高出 17 个百分点,Qwen2.5-7B 和 gpt-oss-20b 上也有类似信号。使用四个每个冲突逻辑回归方向的第 12 层均值进行转向将真实系统合规性从 0.132 提高到 0.530,而主要为合并可分离性选择的方向转向效果较差。因此,用户偏好的冲突解决可以与可读的内部仲裁信号共存,并且成功的干预取决于读出的几何形状,而不仅仅是探头精度
