论文
当综合用户失败时:LLM 模拟人类调查响应的跨域基准
When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses
摘要
大语言模型 (LLM) 越来越多地用作合成用户、人类受访者的替身,其模拟答案提供产品、政策和市场决策。我们询问这种替代何时有效、何时失败,并将答案打包为智能合成用户系统的评估框架。跨两个系列和 8B 到前沿能力范围的四个模型运行的单一协议适用于真实人类反应数据的两个独立领域:美国一般社会态度(一般社会调查)和跨文化价值观(世界价值观调查)。每个模型都根据一套适合保留的人类数据的非 LLM 基线进行基准测试。在人口统计提示和我们测试的调查模拟协议下,两个失败在两个领域、所有四个模型和两个系列中重复出现。首先,在个人层面上,即使是最强的基线,LLM 也无法击败;在跨文化价值观上,每个模型都远远低于它,并且差距在距离感知和适当的评分下仍然存在。其次,模型系统性地过度确定了人口统计数据,将身份视为比真实的人更能预测态度,几乎每个问题组组合都存在扭曲,并且对于编码不变的测量来说是稳健的。这两种失败都无法通过更大、更强大的模型来弥补。决策影响分析表明了为什么这在实践中很重要:在细分目标任务中,模型将细分之间的差距扩大了两到四倍,在一半的美国和大多数跨文化案例中将团队引导到错误的细分,并制造了真实的人中不存在的细分。我们根据要求提供跨域基准和评估框架,以便团队可以提前确定合成用户证据何时对于决策支持是安全的,何时不安全。