论文
模拟受访者,而不是单个问题:使用大语言模型生成连贯的调查
Simulating Respondents, Not Single Questions: Coherent Survey Generation with Large Language Models
摘要
大语言模型越来越多地用于模拟社会调查中的响应分布。先前的工作已经实现了对个别问题的准确群体水平模拟。然而,真正的问卷调查会询问每个受访者一系列相关的问题。模拟受访者应该在整个调查问卷中显示出一致的偏好,而不仅仅是孤立项目的准确分布。现有的单项方法无法准确再现同一个人如何回答完整的调查。我们提出 FullRespondent-LLM (FR-LLM),它对两个专门的 LLM 进行微调:每个项目的响应分布的边际模型和答案之间依赖关系的受访者级别自回归模型。然后,边缘约束联合投影 (MCJP) 将自回归联合分布投影到满足第一个模型学习到的项目级边缘的集合上。这样可以生成具有真实跨项目关系的完整调查问卷,同时保持较高的项目级别准确性。在两个现实世界的社会调查数据集上,FR-LLM 更准确地再现多问题响应模式,保持有竞争力的单项准确性,并更好地概括未知的人群和问题。在小型商业调查数据集中,我们使用模拟响应来做出定价和库存决策; FR-LLM 实现的利润最高。