论文
超越平均水平:评估 LLM 在分布层面的人类调查复制
Beyond Averages: Evaluating LLMs on Human Survey Replication at the Distributional Level
摘要
LLM 越来越多地用于模拟人类调查响应,但之前的工作主要使用平均水平或聚合协议来评估复制,对于 LLM 是否再现人类行为的可变性提供了有限的见解。我们使用 2010 年韩国方便面购买的非公开消费者选择实验,在分布层面评估基于 LLM 的调查复制,这一设置不太可能与 模型训练 数据重叠。我们评估不同统计类型的三个响应变量:二元购买发生率、分类品牌选择和统计购买数量。对于每一个,我们都比较人类和 LLM 在平均水平、模式和分布对齐方面的反应,并与仅来自人类数据的参考基线进行比较。 LLM 相当好地再现了条件水平模式,但未能捕获分布结构:对于购买数量,没有模型能够击败仅与汇总的人类分布相匹配的条件不敏感基线。由于与人类平均值相匹配的模型仍然可以产生比该基线更远离人类的分布,因此仅基于平均值的评估可能会产生误导。复制也随着输入配置的不同而变化,结构化角色和多模式输入改善了一致性,而显式推理提示则单调地降低了一致性。