论文

了解基于大语言模型的人类行为模拟的可靠性

Understanding Reliability in LLM-based Human Behavior Simulation

模型评测评测方法与指标

摘要

大型语言模型 (LLM) 越来越多地用于模拟人类调查反应和行为反应,但不可靠的模拟可能会误导社会科学结论。然而,现有的评估侧重于端到端分数,不清楚模拟过程的不同方面如何相互作用以确定可靠性。我们提出了 ReliMap,它将基于 LLM 的人类行为模拟分解为三个结构化层,并跨三个配置维度评估个体级别 (R1) 和群体级别 (R2) 的可靠性:模型容量、配置文件完整性和群体覆盖率。通过四个模拟任务和十一个大语言模型的实验,我们发现所有模型在没有配置文件条件的情况下都表现出很大的分布偏差。轮廓调节以收益递减的方式减少了这种偏差。更大的模型受益更多,属性信息比数量更重要。至关重要的是,R1 增益并不能可靠地转移到 R2——个体和群体水平的可靠性可能朝相反的方向发展。在群体层面,增加覆盖范围会减少方差,但不会减少系统偏差,R2 稳定在 50-100 人左右。这些发现强调,可靠的模拟无法通过单独优化任何单层来实现,而是需要在所有三层之间进行协调改进。