论文

Urban-ImageNet:城市空间感知的大规模多模态数据集和评估框架

Urban-ImageNet: A Large-Scale Multi-Modal Dataset and Evaluation Framework for Urban Space Perception

模型评测基准与评测资源

摘要

我们提出了 Urban-ImageNet,这是一个大规模多模态数据集和评估基准,用于根据用户生成的社交媒体图像进行城市空间感知。该语料库包含 2019 年至 2025 年间从中国 24 个城市的 61 个城市网站收集的超过 200 万张公共社交媒体图像和配对文本帖子,并具有 1K、10K 和 100K 规模的受控基准子集以及用于大规模训练和评估的完整 2M 语料库。 Urban-ImageNet 由 HUSIC 组织,HUSIC 是一个分层城市空间图像分类框架,定义了基于城市理论的 10 类分类法。该分类法旨在区分激活和非激活的公共空间、外部和内部城市环境、住宿空间、消费内容、肖像和非空间社交媒体内容。 Urban-ImageNet 不是将城市图像视为通用场景数据,而是评估机器感知模型是否可以捕获城市研究核心的空间、社会和功能区别。该基准测试支持一个标准化库中的三项任务:(T1) 城市场景语义分类、(T2) 跨模式图像文本检索和 (T3) 实例分割。我们的实验评估了代表性视觉、视觉语言和分割模型,揭示了在监督场景分类方面的强大性能,但在跨模式检索和实例级城市对象分割方面更具挑战性的行为。一项多尺度研究进一步检验了随着平衡训练数据从 1K、10K 到 100K 图像的增加,模型性能如何变化。 Urban-ImageNet 提供了一个统一的、以理论为基础的多城市基准,用于评估人工智能系统如何跨模式、规模和任务制定感知和解释当代城市空间。数据集和基准可在以下位置获取:huggingface.co/datasets/Yiwei-Ou/Urban-ImageNet 和 github.com/yiasun/dataset-2。