论文

可读、忠实、使用:语言模型中人口特征的三个可分离属性

Readable, Faithful, Used: Three Dissociable Properties of Demographic Identity in a Language Model

模型评测模型行为与机制分析

摘要

大语言模型 被广泛用于模拟调查受访者,但它们的输出是同质的并且不忠实于真实的组间差异,并且这是否反映了模型所知道或使用的内容尚未得到测试。使用针对皮尤美国趋势面板 真值 的代表性相似性分析,我们对 Mistral-7B 中的人口统计读数位置进行评分,并对六种属性类型进行因果干预。内部几何结构是忠实的:注意力头读数主导了标准残差读数,选择校正$ρ$高达0.63——大约是测量可靠性上限的70%——并且一个头,L11 H16,在所有六种类型中都非常忠实,尽管基于种族的类型仍然很弱并且迅速脆弱,在第二个模型系列中复制。然而因果使用并不能追踪保真度:最清晰的因果路径 ($p=0.002$) 属于最不忠实的类型之一,最忠实的类型没有表现出修正幸存效应,并且即时移动预测中的完全身份交换不到其误差的 2%。该头上的 128 维探测器比模型的答案更接近调查真相 21-31%,但几乎无法恢复每个问题的组排序。可读、忠实排列和因果使用是同一模型的三个可分离的属性;将它们视为一种主张是“LLM 能否模拟人群”争论一直未能解决的原因。