论文
开放权重LLM能否保留调查人群的跨量表统计关系
Can Open-Weight Large Language Models (LLMs) Simulate Human Survey Populations? A Cross-Instrument Calibration Study
摘要
大语言模型(LLM)越来越多地用于生成综合调查受访者和真人的数字孪生,但其输出是否保留了真实的人类统计结构而不是表面的合理性,仍然悬而未决,而且大多数现有证据来自专有模型而不是开放权重模型。我们在跨仪器校准任务中评估了三个开放权重LLM系列:根据真实受访者对一种心理测量仪器的逐字回答来调节角色,并在第二个构造距离控制的仪器上对其进行测量,并与 2,058 人的人类小组进行检查。在 139 对网格中,模拟的跨仪器相关性在每个模型中跟踪 r = 0.70 - 0.73 处的真实人类相关性,主要由正确的符号而不是精确的幅度驱动,并且集中在中等构造距离的对中。这种程度的相关性是从仅以个人层面的调查数据为条件的未经调整的开放权重模型中获得的,对于基于LLM的行为模拟和数字孪生应用来说是一个令人鼓舞的结果:特定的模型系列和版本已经再现了真实人类跨仪器结构的有意义的份额,而无需任何微调。然而,这一功能并不会在模型版本之间单调改进:在匹配的面板上,三个经过测试的 Llama 版本中的最新版本在三个标题指标中的两个上表现最差,因此在实践中实现其承诺需要特定于版本的距离感知验证,而不是一次性基准。