论文
行为历史优于人物描述:LLM 合成人物的个体预测研究
Behavioral History Outperforms Descriptions of the Person for LLM Synthetic Personas
摘要
大语言模型 (LLM) 越来越多地用作代表调查受访者的合成角色。它们作为特定受访者替代品的有效性取决于它们是否再现了个人的决定。我们研究了哪些信息可以帮助综合受访者预测每个人后来的选择,使用五个条件逐渐添加更丰富的信息:无个人信息、人口统计、个性特征、认知得分,最后是受访者早期的调查选择作为行为历史。我们使用了由 845 名美国成年人组成的两波小组,他们完成了 14 种行为偏差(涵盖风险、时间偏好、过度自信和推理)的测量,因此每个受访者之前的答案都提供了人类重测基准;在行为历史条件下,所有得分为目标偏差的项目都将被保留。在总体水平上,每种情况下每个受访者的平均偏差数接近人类平均水平(7.1-8.1 偏差,而人类为 7.1)。这种总体相似性掩盖了方差的差异:角色描述只能恢复人类人际变异的 53-67%,而添加行为历史可以将其恢复到大约人类水平。在个人层面,基于描述的人物角色仅达到人类重测反应中观察到的信息丰富度的 7-12%,而添加行为历史则将这一数字提高到 28%。包括行为史在内的条件在所有 17 个人口群体中具有最高的估计信息量,而基于描述的条件为某些群体提供很少或没有信息。综合反应还表现出比人类反应更强的教育和收入相关差异。对于 LLM 合成角色,受访者过去的答案比对他们是谁的描述更多地增加了个人层面的预测。