论文
3DCity-LLM:为 3D 城市规模感知和理解提供多模态 大语言模型
3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding
摘要
虽然多模态 大语言模型 在以对象为中心或室内场景中表现出色,但将其扩展到 3D 城市规模环境仍然是一项艰巨的挑战。为了弥补这一差距,我们提出了 3DCity-LLM,这是一个专为 3D 城市规模视觉语言感知和理解而设计的统一框架。 3DCity-LLM 采用从粗到细的特征编码策略,包括目标对象、对象间关系和全局场景的三个并行分支。为了促进大规模训练,我们引入了 3DCity-LLM-1.2M 数据集,该数据集包含七个代表性任务类别的约 120 万个高质量样本,范围从细粒度对象分析到多方面场景规划。这个经过严格质量控制的数据集集成了明确的 3D 数值信息和多样化的面向用户的模拟,丰富了城市场景的问答多样性和真实性。此外,我们应用基于文本相似性度量和基于 LLM 的语义评估的多维协议,以确保所有方法的忠实和全面的评估。对两个基准的大量实验表明,3DCity-LLM 显着优于现有的最先进方法,为推进空间推理和城市智能提供了一个有前途且有意义的方向。源代码和数据集可在 https://github.com/SYSU-3DSTAILab/3D-City-LLM 获取。