论文

从视频中学习空间智能多模态的几何表示 大语言模型

Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models

摘要

多模态 大语言模型 (MLLM) 擅长 2D 语义理解,但缺乏内在的 3D 感知,导致表示无法保持视频帧之间的几何和空间一致性。鉴于大规模 3D 数据的稀缺性,我们提出了 GeoVR,这是一种使用纯 2D 视频序列学习几何表示的新颖框架。这种方法有效地重构了 MLLM 内的语义潜在空间,以解锁空间智能。 GeoVR 没有采用表面特征混合,而是通过从预先训练的 3D 基础模型中提取几何知识来重塑 MLLM 的内部表示。这是通过由四个互补几何目标驱动的多目标学习策略来实现的:(1) 估计帧间相机姿势以嵌入不同的视点动态,(2) 回归密集深度图以锚定物理距离,(3) 预测用于现实世界校准的度量比例因子,以及 (4) 提取多尺度 3D 特征以对齐中间特征空间。在这些明确的物理和几何约束的指导下,模型的内部表示自然会发展出强大的 3D 意识。空间推理基准的大量实验表明,GeoVR 实现了最先进的性能,为赋予基础模型空间智能建立了新的范例。