论文

大规模人口提示:当更多属性受到伤害时 LLM——人类协议

Demographic Prompting at Scale: When More Attributes Hurt LLM--Human Agreement

上下文与知识上下文工程

摘要

我们研究了作为提示线索提供的注释者人口统计属性如何在五个任务中形成 大语言模型 (LLM) 预测和人工注释之间的一致性。使用五个开源 LLM,我们系统地改变提示中人口统计成分的数量和构成,涵盖从单属性到全属性配置的每种组合。我们的实验揭示了三个主要发现。首先,比对始终以一到三个高信号属性达到峰值,并在完整属性集下下降,从而建立了明确的超规格阈值。其次,人口统计对人类注释影响的总体程度并不能预测哪些属性可以改善 LLM 对齐;相反,需要共同考虑每个属性注释信号的可学习性和方向一致性。第三,神经元探测表明,专门的激活仅在相干注释信号下与对齐增益相关,并且单独的激活量并不意味着可操纵性。总之,这些结果表明人口统计提示并不是单一的干预措施:其效用高度依赖于上下文,由属性信号质量、任务特征和模型架构决定。