论文
DUDA-Bench:多模态城市诊断Agent评测
DUDA-Bench: Benchmarking LLM Agents on Multimodal Data-Driven Urban Diagnosis
摘要
城市诊断整合异质观察来识别城市问题、定位受影响区域并调查影响因素,为基于证据的城市规划和管理提供信息。然而,它对劳动密集型、针对特定案例的专家工作流程的依赖限制了可扩展性和重用,从而激发了对基于Agent的执行的探索。为了评估这种能力,我们引入了 DUDA-Bench,这是一种分层的交互式基准,它将数据驱动的城市诊断形式化为多阶段Agent工作流程。它包含跨越四个分析阶段的 86 个原子任务和 22 个工作流任务,基于来自 12 个城市、涵盖 5 种城市问题类型的多模式数据。对七个骨干模型和五个Agent系统的评估揭示了孤立的分析能力和端到端诊断之间的巨大差距,不同骨干的系统优势各不相同。轨迹分析表明,未解决的证据差距会跨阶段传播,而成功的恢复则需要使用反馈来修改假设和行动。这些发现凸显了跨阶段协调分析能力的局限性,特别是适应性规划、证据整合和验证。更广泛地说,DUDA-Bench 提供了一个框架,用于将专家分析工作流程转化为分层Agent任务和流程感知评估,支持端到端分析能力的系统评估。
