论文
Imagine3D-LLM:教 MLLM 在回答之前想象 3D 场景
Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering
摘要
从多视图图像推理 3D 世界仍然是多模态大语言模型 (MLLM) 的基本挑战。虽然现代 MLLM 可以有效地处理单图像输入,但它们很难将跨观点的证据整合到连贯的 3D 理解中。越来越多的工作试图通过将 3D 感知注入 MLLM 来缩小这一差距,要么通过增强细粒度像素级交叉视图对应,要么通过融合 3D 几何基础模型的特征,但与人类推理之间仍然存在巨大差距。在这项工作中,我们重新审视人类空间推理,这表明人类不依赖于细粒度的几何线索,而是粗略地识别不同视图中的常见对象,推断视点之间的相对几何形状,并组装场景的粗略 3D 布局。受此过程的启发,我们引入了 Imagine3D-LLM,这是一种 MLLM,它学习组装场景的类似紧凑 3D 表示,并根据该表示确定其答案。具体来说,我们在图像标记后面附加一小组可学习的摘要标记,将它们解码为由光度重建损失监督的紧凑的 3D 高斯分布表示,并与标准的下一个标记预测目标联合训练。值得注意的是,虽然只有摘要标记接受直接重建监督,但这一目标还在 LLM 的底层图像特征中引发了更强的跨帧对应,这表明学习重建会在整个模型中传播 3D 感知信号。因此,Imagine3D-LLM 在多个空间推理和 3D 理解基准上始终优于先前的方法,这表明想象场景比被告知其像素级几何更有效。