论文
DisasterBench:类型化工具接口约束下的 LLM 规划基准测试
DisasterBench: Benchmarking LLM Planning under Typed Tool Interface Constraints
摘要
灾害会造成严重的社会影响,需要异构人工智能工具的快速协调,从卫星分析到洪水预测和损害评估,形成连贯的多步骤工作流程。随着 LLM 越来越多地充当此类管道的协调器,有效的协调需要的不仅仅是选择语义上合理的工具:LLM 必须生成具有正确参数绑定和依赖关系传播的可执行工作流。我们引入了 DisasterBench,这是一个基准,用于通过语义相似但操作上不同的灾难响应工具来评估结构化多智能体规划。为了实现步骤级故障归因,我们进一步提出了第一点故障(FPoF),它定位了预测工作流程中最早的根本原因,将主要错误与下游级联效应分开。我们的评估揭示了三个发现:规划方法的有效性在很大程度上取决于模型能力;工具不匹配和参数绑定错误主导了首次失败,揭示了语义基础和执行一致性是明显的瓶颈;冗长的中间推理可能会导致指令与结构化输出要求发生冲突,从而扰乱计划的生成。总之,这些发现凸显了语义推理和基于执行的协调之间的根本差距,强调了对联合建模语义意图、执行约束和工作流一致性的规划框架的需求。代码、数据和评估资源可从以下网址获取:https://github.com/TamuChen18/DisasterBench_Open