论文
SpatialBlock:通过合成块堆叠问题增强 LVLM 中的空间智能
SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem
摘要
大视觉语言模型 (LVLM) 在各种视觉任务上取得了强大的性能,但它们重建和推理 2D 图像中描绘的场景的 3D 结构(称为空间智能)的能力仍然有限。现有方法试图通过使用需要密集几何注释的真实场景空间问答数据集来解决这一差距。然而,构建此类标签成本高昂、耗时,并且由于依赖外部感知模块而常常存在噪音。在这项工作中,我们提出了一种受人类认知发展启发的新颖范式:通过结构化块操作任务学习基础空间技能。我们引入了 SpatialBlock-15k,这是一个包含 15,000 个块堆叠问题的综合数据集,涵盖 3D 到 2D 投影、视点转换和结构组合。该数据集进一步纳入受控颜色调制作为视觉线索,以鼓励在视觉复杂的条件下进行基于锚点的推理。实验表明,尽管数据集具有合成性和紧凑性,但通过直接回答或基于推理的预测在我们的数据集上训练的 LVLM 显着优于基线,并可推广到现实世界的空间任务。代码和数据可在 https://github.com/rsoohyun/SpatialBlock 获取。