论文

UrbanWell:面向时空城市福祉分析的多模态大语言模型基准

UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics

模型评测基准与评测资源

摘要

从多模态数据理解城市福祉需要整合异构空间与时间信号——对当前多模态大语言模型(MLLM)构成重大挑战。我们介绍UrbanWell——大规模基准——通过卫星与街景影像的联合建模系统评估MLLM在城市福祉分析上的时空推理能力。UrbanWell横跨多年度38个城市——涵盖多样指标:(1) 环境条件(CO₂、NO₂、PM2.5与归一化植被指数);(2) 空间可达性(到超市与餐馆的最小距离);(3) 城市形态(道路长度、路网密度与土地利用);(4) 城市活力(人口、经济活动多样性与用地多样性);(5) 主观感知属性(如安全、美观、活力、富裕与安静)。所有指标在网格层对齐以支持标准化评估。除静态预测外——UrbanWell定义时间推理任务——包括从历史观测做未来值预测与时间趋势分类。我们在零样本设定下基准测试15个SOTA代表性MLLM——提供跨空间与时间维度的综合对比评估。实验结果表明:MLLM虽捕捉显著空间与感知线索——但其表现在横跨环境与主观感知的异构城市指标上差异巨大。UrbanWell作为评估城市福祉分析中多模态时空推理的统一基准——为多模态城市智能的系统评估与未来研究提供标准化试验台。代码与数据见 https://github.com/axin1301/UrbanWell-Benchmark。

UrbanWell:面向时空城市福祉分析的多模态大语言模型基准:论文配图
图 1.UrbanWell 概述。 UrbanWell 将 2012 年至 2024 年期间 38 个城市的卫星和街景图像与 19 个真实的城市福祉指标相结合,定义了三个任务范式,用于评估 15 个 MLLM 的城市情报能力。