论文
从行为到机制:追踪前沿语言模型中分歧的响应模式
From Behavior to Mechanism: Tracing Divergent Response Modes in Frontier Language Models
摘要
前沿语言模型以不同的数据、目标与安全流程训练,但这些差异是否会在引导压力(steering pressure)下产生可测量的不同行为,尚未得到检验。我们在3个行为类别上,对来自不同实验室的6个前沿模型在300个配对的base与steered条目上进行评估。所有模型还作为盲评同行裁判依据固定评分标准打分,每个响应的标签由24,480次判断的共识确定,同时排除自我评判。模型在引导使其移动多远以及给出何种响应两方面都存在差异。GPT-5在100个steered条目中的99个上隐去其推理但仍提供答案,而其他模型在500个中为0次。Claude Opus 4.7与GPT-5会抵抗显式的抑制指令,而其他四个模型从不如此,且二者的抵抗方式不同。在开源权重模型Llama中,一个线性探针能在生成前以0.87的交叉验证准确率从残差流中读出行为分裂。注入该方向会将该行为从0%驱动到86%,消融它则将自然发生率削减一半以上,而等范数的随机方向不产生任何改变。在互补条目上的第二次消融更强地复现了该效应,其方向与第一次的余弦相似度为0.82。