论文
MV-STRIDE:使 MLLM 通过分层能力建模掌握多视图空间推理
MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling
摘要
尽管多模态 大语言模型 (MLLM) 在 2D 视觉语言任务中取得了快速进展,但由于现有数据集中缺乏结构化 3D 认知路径,强大的多视图空间推理仍然是一个基本瓶颈。为了解决这个问题,我们引入了 MV-STRIDE,一个具有相互依赖和分解功能的多视图分层空间推理数据集。 MV-STRIDE 超越了平面数据结构,明确地模拟了基础感知、场景理解和复杂上下文推理之间的依赖关系,提供了与人类空间认知一致的连贯学习路径。我们开发了一个系统的 QA 生成管道,利用不同的 3D 场景源,强制执行跨视图依赖性约束,以防止单视图可解性,生成由认知基础的思想链监督支持的多级空间推理任务,以进行复杂的推理。广泛的评估表明,我们基于分层数据集的多阶段训练框架在多个空间推理基准上实现了最先进的性能,特别是面向多视图的 MMSI-Bench。我们的方法使 MLLM 能够跨不同视角保持稳健、3D 一致的空间推理。代码和数据集可在 https://co1dspring.github.io/MV-STRIDE/ 获取。