论文
DisasterBench:复杂环境中基于无人机的灾难响应的多模式基准
DisasterBench: A Multimodal Benchmark for UAV-Based Disaster Response in Complex Environments
摘要
当灾难发生时,响应人员不仅必须回答正在发生的事情,还必须回答为什么会发生、接下来会发生什么以及现在该做什么,这通常是从嘈杂的低空无人机视图和严格的现场计算限制下进行的。然而,现有的多模态基准大多强调感知(例如识别/描述),覆盖的灾害类型有限,对实际应急响应所需的多阶段推理支持不足。我们推出了 DisasterBench,这是一种多阶段多模态推理基准,用于复杂环境中基于无人机的灾难响应。 DisasterBench 涵盖灾前、灾中和灾后阶段的 14 种灾害相关场景类型和 9 种响应关键任务,并具有细粒度的灾害任务映射,可明确测试因果归因、传播预测、损害分析和决策导向推理。为了实现边缘推理,我们进一步提出了 DisasterVL,这是一种轻量级多模态模型,采用三级管道进行优化,结合了域指令调整、思想链引导的多模态对齐和基于强化学习的策略优化。在 21 个流行的 MLLM 上进行的实验表明,我们的 2B 参数 DisasterVL 优于所有经过评估的开源模型,并大大缩小了与最先进的闭源模型的差距,以卓越的效率实现了与 GPT-4o 相当的推理精度。该项目页面位于 https://github.com/TanmouTT/DisasterBench。