论文

数字角色何时可以可靠地近似人类调查结果?

When Can Digital Personas Reliably Approximate Human Survey Findings?

模型评测模型能力评测

摘要

由 大语言模型 (LLM) 支持的数字角色越来越多地被提议作为人类调查受访者的替代品,但目前尚不清楚它们何时能够可靠地近似人类调查结果。我们使用 LISS 面板回答这个问题,根据受访者的背景变量和 2023 年之前的调查历史构建人物角色,然后根据相同受访者保留的截止后答案对其进行测试。在四个角色架构、三个 LLM 和两个预测任务中,我们评估了问题、受访者、分布、公平和聚类级别的性能。数字角色改善了与人类反应分布的一致性,特别是在与稳定属性和值相关的领域,但对于个体预测仍然有限,并且无法恢复多变量受访者结构。检索增强架构提供了最明显的收益,但性能更多地取决于人类响应结构而不是模型选择:角色对于低可变性问题和常见响应模式表现最好,而对于主观、异质或罕见响应表现最差。我们的结果为数字角色何时适合调查研究以及何时仍然需要人工验证提供了实用指导。