论文

SpatialCORE:大视觉语言模型中的置信感知基础空间推理

SpatialCORE: Confidence-Aware Grounded Spatial Reasoning in Large Vision--Language Models

模型训练强化学习

摘要

大视觉语言模型(LVLM)在视觉感知任务中取得了显着的进步,但空间推理仍然是一个持续的弱点,特别是对于需要视觉空间推理的问题。最近的空间推理方法结合了生成的基础,其中模型预测与任务相关的对象的边界框、掩模或其他定位输出,作为其推理轨迹的一部分。然而,这些方法通常只优化最终答案的正确性,即使模型没有从自信本地化的任务相关对象中进行推理,也可以奖励正确的答案。我们引入了 SpatialCORE(Spatially CONfident REasoning),这是一个训练后框架,可将模型自身对生成的grounding的置信度转化为空间推理的学习信号。其中心思想是加强准确且自信的基础,鼓励模型从自信的本地化任务相关对象中进行推理。 SpatialCORE 通过自我调节空间奖励来实现这一点,该奖励通过坐标标记置信度对每个预测边界框的匹配质量进行加权。答案门进一步将基础优化与最终答案的正确性联系起来。 SpatialCORE 在跨不同基准的开源和专业空间推理模型中实现了最先进的结果,并在零样本设置中有效地转移到看不见的数据分布。源代码可在 https://github.com/rafiibnsultan/SpatialCORE. 获取