论文
大语言模型能变革调查研究吗?灾害备灾响应实验
Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses
摘要
调查研究面临日益加剧的结构性挑战:回应率下降、样本偏差、高风险受访者中的块状缺失,以及在线样本库中AI辅助的欺诈性作答。大语言模型(LLM)被视为一种补救手段,但覆盖完整调查流程的严格评估仍然稀缺,在数据质量最为要紧的灾害情境中尤其如此。我们提出并评估一个覆盖问卷设计、样本选择、试点测试、缺失数据插补与收集后分析的五阶段LLM集成框架,并以2024年针对佛罗里达州居民的飓风Milton备灾调查(n=946)作为共享的实证试验台。我们构建了一个受保护动机理论(PMT)约束的共现知识图谱,并开发了七种LLM配置,涵盖零样本推理、检索增强基线以及新颖的理论引导变体。我们提出的锚定边际理论引导LLM(A-TLM)在灾害相关的块状MNAR条件下,RMSE优于全部三种经典插补基线(IPW/MI、MICE+PMM、missForest)(S4 RMSE为1.439,次优为1.496),同时实现接近零的有符号偏差(-0.121),而随机森林插补器产生最大的绝对偏差(-0.631)。围绕PMT因果结构组织检索并在单次模型调用中整合全部证据,优于非结构化检索和分阶段顺序推理(MAE 0.993,标准RAG为1.097)。我们记录到接近零的总体偏差可能掩盖方向相反的子群体误差,并提出将子群体分层偏差审计作为报告标准。一个受检索约束的知识图谱聊天机器人表明,通过有据可依的拒答,幻觉在架构上是可管控的。
