论文

项目平均替代物:为什么更丰富的角色数据无法改进 LLM 作为人类替代物

Item-Mean Surrogates: Why Richer Persona Data Fail to Improve LLMs as Human Surrogates

模型评测模型能力评测

摘要

LLM 越来越多地被用作人类行为模拟器,通常的前提是更丰富的角色数据可以使它们成为特定个体的替代品或探索工具。我们在四个数据集上测试了这一前提,涵盖超过 400,000 名参与者和 6,000 多个调查项目和实验结果。 LLM 在总体水平上表现良好:它们的平均反应与人类对相同项目的平均反应非常一致。但这种成功很大程度上反映了对每个项目的平均人类反应的预测。一旦删除每个项目的人类均值,LLM 预测只能解释剩余受访者特定变异的 3.05%,远低于 53.6% 的人类重测基准。更丰富的角色、模型变体和 微调 并不能缩小这一差距。在方差分析中,一旦移除项目均值,可靠的剩余信号是逐个项目的。它反映了受访者在特定项目上偏离平均值的情况,比稳定人效应大约 8.9 倍。角色数据对受访者进行编码,但不编码该项目特定的偏差。 LLM 响应还使用更小的分布、更少的响应类别和扭曲的分布形状来压缩人类响应分布。我们将这种模式称为项目均值替代。当前的 LLM 替代者可以近似项目平均值,但不能替代个体人类所需的分布或特定于受访者的偏差。我们对基于 LLM 的人类替代主张提出了四种实证检验。