我们还能相信灾难社会感知吗?检测人工智能生成的社交媒体帖子的经验证据
Can We Still Trust Disaster Social Sensing? Empirical Evidence on Detecting AI-Generated Social Media Posts
摘要
灾难社会感知将公共社交媒体帖子转化为态势感知和人道主义需求的证据,但生成人工智能 (AI) 可以产生类似于目击者报告的可信信息。这项研究调查了基于文本的人工智能探测器是否能够可靠地区分人类撰写的灾难帖子和人工智能生成的灾难帖子。我们构建了一个包含 12,000 篇文本的数据集,这些文本被组织成来自 9 场灾难的 3,000 个匹配的语义单元:原始人类帖子 (H0)、经过最低程度 LLM 校对的人类帖子 (H1)、基于相同验证事实的人工智能生成的真实帖子 (A0) 以及这些人工智能帖子的情感框架版本 (A1)。来自 42 个事件的单独 6,000 个文本语料库支持模型选择和阈值校准。我们评估了五个模型系列中的 OSM-Det、Fast-DetectGPT、双筒望远镜和直接大语言模型 (LLM) 判断,然后测试灾难域校准、冻结编码器线性读出、配对转换灵敏度和数据集伪影控制。在 14 个冻结跨系列配置中,AUROC 为 0.402-0.517,在校准得出的低假阳性操作点处的最佳预期召回率为 3.6%; OSM-Det 达到 AUROC 0.521 和 10.4% 召回率,实现 6.7% 的假阳性率。经过灾难训练的线性头部达到 AUROC 0.817,但七特征表面分类器在 H0 与 A0 对比度上达到 0.784,并且中和识别的表面不对称性将头部从 0.733 降低到 0.594。即使出处没有改变,头部也将 A0 与 A1 分开。结果表明,基于文本的检测不够可靠,无法充当可操作的信任门;应依靠多模态索赔、可靠来源和其他背景证据来维护对灾害社会感知的信任。