论文
大语言模型 中的偏好头:可解释个性化的机制框架
Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
摘要
大语言模型 (LLM) 表现出强大的隐式个性化能力,但大多数现有方法将此行为视为黑匣子,依赖于用户数据的提示工程或 微调。在这项工作中,我们采用机械可解释性的视角,并假设存在一组稀疏的偏好头,即编码用户特定风格和主题偏好并对生成产生因果影响的注意力头。我们引入了差异偏好引导(DPS),这是一个 无需训练 框架,它(1)通过因果屏蔽分析识别偏好头,(2)利用它们在推理时实现可控和可解释的个性化。 DPS 计算每个注意力头的偏好贡献分数(PCS),直接测量其对用户对齐输出的因果影响。在解码过程中,我们对比有和没有偏好头的模型预测,放大个性化和通用 logits 之间的差异,以有选择地加强偏好对齐的延续。在多个 LLM 上广泛使用的个性化基准上进行的实验表明,在保持内容一致性和低计算开销的同时,个性化保真度得到了一致的提高。除了经验改进之外,DPS 还提供了 Transformer 架构中个性化出现位置和方式的机械解释。我们的实施是公开的。