论文
探索语言模型中与角色相关的偏好
Probing Persona-Dependent Preferences in Language Models
摘要
大语言模型 (LLM) 可以说是有偏好的:他们可靠地选择某些任务和输出而不是其他任务和输出,而由 后训练 和提示形成的偏好似乎会影响他们的大部分行为。但模型也可以采用具有完全不同偏好的不同角色。这在内部是如何实施的?每个角色是否使用自己的偏好表示,或者某些表示是共享的?我们在 Gemma-3-27B 和 Qwen-3.5-122B 的残差流激活上训练线性探针,以预测显示的成对任务选择,并识别真正的偏好向量:它跟踪模型在一系列提示和情况下的偏好变化,并在 Gemma-3-27B 上沿着它的方向控制成对选择。一些偏好信息会在我们测试的提示角色之间传输:在有用的助手上训练的探针可以预测并引导不同性质的角色的选择,包括其偏好与助理的偏好反相关的邪恶角色。