论文

DisasterTD:使用多模式 LLM 和跨视图地理定位进行灾难地名消歧

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

应用与实践视觉感知与空间理解

摘要

社交媒体图像 (SMI) 提供及时且精细的地面视角,对于态势感知和应急响应非常有价值。与卫星或航空图像不同,SMI 可以及时捕捉灾害影响和地面状况。然而,SMI 中的地理参考通常是模糊或不明确的,这使得准确的地理定位具有挑战性。为了解决这个问题,我们提出了 DisasterTD,一种灾难地名消歧框架,它将基于多模态 大语言模型 (MLLM) 的语义推理与跨视图地理定位相集成。首先,MLLM 提取地名并从嘈杂的文本输入中生成候选地理位置。然后,使用 SMI、遥感图像 (RSI) 和可选的街景图像 (SVI) 之间的交叉视图匹配来验证和细化这些候选结果。我们在飓风哈维数据集上评估了 DisasterTD,其中 SMI 通过收集的 RSI 和 SVI 进行了增强,以构建灾难地理定位的跨视图基准。根据地名清晰度和模糊性,数据集分为四个类别,允许跨场景进行细粒度的性能分析。结果表明,DisasterTD 在没有歧义的情况下始终优于仅 MLLM 和仅跨视图基线,实现了 1000 m 内 71.62%、500 m 内 62.36%、250 m 内 57.99%、100 m 内 52.09% 和 50 m 内 47.01% 的地理定位精度,同时将平均误差和中值误差降低到分别为11.33公里和0.68公里。最大的改进出现在不明确的地名中,其中具有跨视图证据的语义推理减少了候选分散和错误。这些发现证明了将基于 MLLM 的候选生成与交叉视图验证相结合以实现细粒度灾难地理定位的有效性。