论文

软空间推理

Soft Spatial Reasoning

模型推理推理策略与问题分解

摘要

大型视觉语言模型 (LVLM) 通常通过思维链 (CoT) 执行空间推理,将中间推理编码为离散语言标记的自回归序列。这种艰苦的思考需要在每一步都致力于一个单一的标记,即使正确的空间解释仍然不确定。这种早期承诺构成了过早的离散化:不正确的词元选择可能会通过后续推理传播错误。我们提出了 Soft Spatial Reasoning,这是一种训练后框架,引入了 LVLM 中空间任务的软思维。在每个中间推理步骤中,LVLM 通过混合词元嵌入而不是选择单个词元来形成连续的软状态,从而允许多个候选延续影响下一步。然而,适当的软化程度可能因推理步骤而异:保留多个候选可能会保留有用的空间解释,但如果这些候选意味着冲突的空间关系,则将它们混合可能会干扰后续推理。软空间推理的核心是 AdaptSoft,它是一个控制器,它使用当前隐藏状态和预测不确定性来调整每个推理步骤的软度。为了训练 AdaptSoft,我们引入了梯度对齐学习目标,该目标为软度控制提供特定于步骤的学习信号,无需中间推理监督。在不同的空间基准中,软空间推理优于使用相同主干的硬和固定软 CoT 基线以及一系列现有的 LVLM。源代码可在 https://github.com/rafiibnsultan/Soft_Spatial_Reasoning 获取