论文
LLM智能体能应对灾害吗?应急行动中异构地理空间推理的基准测评
Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations
摘要
实际业务中的灾害响应远不止损害评估,还要求响应人员整合多传感器信号,对路网、人口和关键设施进行推理,规划疏散,并产出可执行的报告。然而,已有工作大多孤立地研究遥感感知或评估通用工具使用,对应急行动的端到端工作流探索不足。本文提出灾害行动响应智能体基准(DORA),首个面向端到端灾害响应的智能体基准:涵盖10类灾害的45个真实灾害事件上的515个专家编写任务,并配有专家核验、可回放的金标准轨迹,总计3,500步工具调用。任务覆盖灾害响应业务流程的五个维度:灾害感知、空间关系分析、救援与疏散规划、时序演化推理和多模态报告生成。智能体需从包含108个工具的MCP库中组合调用,处理异构地理空间数据:跨单时相、双时相和多时相序列的光学、SAR和多光谱影像(GSD 0.015-10米),辅以高程和社会矢量图层。我们在基准上全面评估了13个前沿LLM,揭示出三个持续存在的挑战:1) 灾害领域接地暴露出独特的失败模式(损害语义接地、传感器模态错配和灾害流程组合);2) 智能体受到工具选择和参数接地双重瓶颈制约,金标准工具顺序提示仅带来1.08-4.40%的准确率提升,替代脚手架最多带来3.24%的增益;3) 组合脆弱性随轨迹长度增长,长流水线上智能体与金标准的差距从7%扩大到56%。DORA为具备业务可靠性的灾害响应智能体建立了一个严格的测试平台。
