论文

CrossView Suite:利用数据集、模型和基准来利用 MLLM 的跨视图空间智能

CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark

模型评测基准与评测资源

摘要

空间智能需要多模态 大语言模型 (MLLM) 来超越单视图感知,并对跨多个视点的对象、可见性、几何形状和交互进行一致的推理。然而,跨视图推理的进展仍然受到三个主要差距的限制:缺乏大规模注释良好的训练数据,缺乏系统评估的全面基准,以及缺乏建立跨视图对象级一致性的明确对齐机制。为了解决这些差距,我们跨三个协调组件彻底开发了 CrossView Suite:CrossViewSet、CrossViewBench 和 CrossViewer。首先,我们引入了一个多智能体数据引擎来精心策划一个大规模、高质量的跨视图指令数据集,称为 CrossViewSet,涵盖 17 种细粒度任务类型和 160 万个样本。其次,我们精心创建了一个场景不相交的CrossViewBench来全面评估MLLM的跨视图空间理解能力,从各个方面对其进行评估。最后,我们提出了 CrossViewer,这是一种用于 MLLM 中跨视图空间推理的渐进式三阶段框架,遵循感知 -> 对齐 -> 推理范式。我们的方法配备了自适应空间区域标记器来捕获细粒度的对象表示,然后显式地对齐多视图对象,从而融合对齐的特征以提高 MLLM 的跨视图推理能力。大量的实验和分析表明,大规模训练数据、系统评估和明确的跨视图对齐对于将 MLLM 从单视图感知推进到现实世界的空间智能至关重要。该项目页面位于 https://github.com/Thinkirin/Crossview-Suite。