论文

定位和控制 大语言模型 中的隐式个性化

Locating and Controlling Implicit Personalization in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 经常会根据隐含的人口统计线索改变输出,即使用户从未声明过人口统计身份。之前的工作已经记录了这种行为,但这些行为变化与模型内部激活之间的联系仍不清楚。使用五个 LLM 中匹配的提示和中性对话,我们确定局部内部激活信号跟踪推荐的变化,相关性高达 r=0.87。当多个线索同时出现时,它们的内部信号很大程度上结合在一起,但输出的变化并不是简单地相加。我们进一步表明,删除与某一提示相关的内部信号可以抑制其影响,通常比要求模型通过提示忽略人口统计数据更有效,同时在很大程度上保留一般基准性能。然而,选择性地消除一个维度的影响同时保持共存维度完整的能力仍然是高度模型和属性特定的。这些结果将隐式个性化行为与可以分析和因果控制的内部信号联系起来。