论文
模拟还是估计?用于意见模拟的基础语言模型和训练后语言模型的不同优势
Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation
摘要
大语言模型 越来越多地用于模拟人类观点,但之前的工作报告了相互矛盾的结果:一些研究发现与人类调查数据有希望一致,而另一些研究发现角色崩溃和人口统计学敏感性较弱。我们认为,这种冲突很大程度上源于将两项不同的任务混为一谈。我们将第一个任务称为模拟,其中模型生成个体响应,并聚合成总体分布。我们称之为第二个任务估计,其中模型直接预测人口分布。通过评估皮尤美国趋势面板上的六个匹配的基础模型和训练后模型,我们发现基础模型是更强的模拟器:它们产生的响应分布更接近人类 真值,并且更好地保留人口结构。经过训练的模型通常是更强的估计器,在直接询问时会产生更准确的分布预测。我们认为,人类模拟的模型选择应该以任务是否需要生成文本或预测分布为指导。