论文

DUDA-Bench:多模态城市诊断Agent评测

DUDA-Bench: Benchmarking LLM Agents on Multimodal Data-Driven Urban Diagnosis

智能体系统应用与实践Agent任务评测行业应用

摘要

城市诊断整合异质观察来识别城市问题、定位受影响区域并调查影响因素,为基于证据的城市规划和管理提供信息。然而,它对劳动密集型、针对特定案例的专家工作流程的依赖限制了可扩展性和重用,从而激发了对基于Agent的执行的探索。为了评估这种能力,我们引入了 DUDA-Bench,这是一种分层的交互式基准,它将数据驱动的城市诊断形式化为多阶段Agent工作流程。它包含跨越四个分析阶段的 86 个原子任务和 22 个工作流任务,基于来自 12 个城市、涵盖 5 种城市问题类型的多模式数据。对七个骨干模型和五个Agent系统的评估揭示了孤立的分析能力和端到端诊断之间的巨大差距,不同骨干的系统优势各不相同。轨迹分析表明,未解决的证据差距会跨阶段传播,而成功的恢复则需要使用反馈来修改假设和行动。这些发现凸显了跨阶段协调分析能力的局限性,特别是适应性规划、证据整合和验证。更广泛地说,DUDA-Bench 提供了一个框架,用于将专家分析工作流程转化为分层Agent任务和流程感知评估,支持端到端分析能力的系统评估。

DUDA-Bench:多模态城市诊断Agent评测:论文原图
图 1:DUDA-Bench 概述。该基准将分层任务分类法和多模式城市案例数据集与交互式代理环境连接起来,并将城市诊断制定为四阶段分析工作流程。