论文

大语言模型能变革调查研究吗?灾害备灾响应实验

Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses

应用与实践科学研究

摘要

调查研究面临日益加剧的结构性挑战:回应率下降、样本偏差、高风险受访者中的块状缺失,以及在线样本库中AI辅助的欺诈性作答。大语言模型(LLM)被视为一种补救手段,但覆盖完整调查流程的严格评估仍然稀缺,在数据质量最为要紧的灾害情境中尤其如此。我们提出并评估一个覆盖问卷设计、样本选择、试点测试、缺失数据插补与收集后分析的五阶段LLM集成框架,并以2024年针对佛罗里达州居民的飓风Milton备灾调查(n=946)作为共享的实证试验台。我们构建了一个受保护动机理论(PMT)约束的共现知识图谱,并开发了七种LLM配置,涵盖零样本推理、检索增强基线以及新颖的理论引导变体。我们提出的锚定边际理论引导LLM(A-TLM)在灾害相关的块状MNAR条件下,RMSE优于全部三种经典插补基线(IPW/MI、MICE+PMM、missForest)(S4 RMSE为1.439,次优为1.496),同时实现接近零的有符号偏差(-0.121),而随机森林插补器产生最大的绝对偏差(-0.631)。围绕PMT因果结构组织检索并在单次模型调用中整合全部证据,优于非结构化检索和分阶段顺序推理(MAE 0.993,标准RAG为1.097)。我们记录到接近零的总体偏差可能掩盖方向相反的子群体误差,并提出将子群体分层偏差审计作为报告标准。一个受检索约束的知识图谱聊天机器人表明,通过有据可依的拒答,幻觉在架构上是可管控的。

大语言模型能变革调查研究吗?灾害备灾响应实验:论文配图
图 1:理论约束的分阶段预测流程。六阶段 PMT 级联通过按时间排序的构造将 A 组人口输入映射到飓风准备结果。显示 PMT 约束图中保留的边;已验证的边(Spearman 符号一致)会突出显示。