论文

Ouroboros-Spatial:关闭空间推理的数据模型循环

Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning

模型训练合成数据

摘要

空间推理仍然是多模态 大语言模型 (MLLM) 的持续挑战。现有方法在很大程度上依赖于大规模、静态管理的数据集,无论模型的发展能力如何,所有训练样本都会得到统一处理。这种静态范式本质上是数据效率低下的:训练容量通常花在对于当前阶段的模型来说微不足道或过于困难的样本上。为了解决这个限制,我们提出了 Ouroboros-Spatial,这是一种自我进化的训练框架,其中模型扮演着提议者和求解者的双重角色。在每次迭代中,冻结的提议者都会根据 3D 场景元数据和原始视频帧生成空间问答 (QA) 对,以及用于导出可靠的 真值 的可执行代码。然后,可学习的求解器在接受的样本上进行微调,并将其每个样本的预测置信度用作难度信号。该信号在下一次迭代中反馈给提议者,指导其生成更适合求解器当前能力的问题。通过这种闭环设计,训练分布与模型能力共同进化,减少冗余的琐碎示例,同时过滤掉学习价值有限的模糊或无信息样本。在六个空间推理基准中,Ouroboros-Spatial 显着改进了 Qwen3-VL-4B 和 Qwen3-VL-8B,同时使用比最近的大规模精选数据集少一个数量级的训练示例。在 VSI-Bench 上,4B 和 8B 模型分别获得了 9.9 点和 6.8 点的绝对增益,使两者都能超越各种强大的开源和专有基准。