论文

Obshazard-bench:对来自原始地球观测流的实时灾害情报的多模式基础模型进行基准测试

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 越来越多地用于解释地球观测数据,但其支持现实世界灾害应急响应的能力仍未得到充分评估。现有的遥感基准在很大程度上依赖于静态、事后和专家处理的产品,例如网格再分析数据,这些产品很难与灾害快速发展且必须在严格的时间限制下做出决策的灾害情景相一致。为了弥补这一差距,我们引入了 Obshazard-bench,这是一种实时、观察驱动的基准,用于评估 MLLM 中的灾害情报。与以图像为中心或事后基准不同,Obshazard-bench 直接将来自不同卫星传感器的原始高频卫星探测流与同步地面站观测、历史灾害记录和社会经济指标集成在一起,绕过了延迟的专家处理和物理反演管道。该基准涵盖 60 多个国家的 8 个主要灾害类别和 28 个子类别,包含 120 多个历史记录的极端事件案例和数千个面向生命周期的 VQA 样本。此外,Obshazard-bench进一步定义了与灾害操作流程相一致的三阶段评估分类法:用于灾前风险检测和早期预测的预测性危机预期、用于现场灾害跟踪和终止预测的主动演化推理、以及用于灾后震级推算、人道主义负担估计和社会经济影响评估的多方面影响量化。对代表性通用和以地球为中心的基础模型的实验揭示了将原始多通道物理观测结果转化为基于时间和与决策相关的灾害推理的巨大局限性。