论文

优势引导门:重塑基于视觉的空间智能的开放式推理

Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence

模型训练奖励建模与过程监督

摘要

多模态 大语言模型 (MLLM) 在复杂的空间场景理解和推理任务中表现出了巨大的潜力。然而,他们的开放式推理过程很容易出现决策错误和错误累积,导致答案质量不稳定。为了解决这个问题,我们提出了一种优势引导的门控框架,可以在推理过程中动态干预并纠正偏差。具体来说,我们将逐步推理建模为有限范围的决策过程,并在推理树上引入蒙特卡罗值评估以提供中间监督信号。该框架包括Step-Advantage Gate和Trajectory-Advantage Gate,分别动态选择高价值推理步骤和高质量完整推理轨迹。在训练过程中,我们使用通过多分支采样生成的推理树对门进行监督学习,并将共享参数初始化与特定于任务的头相结合,以实现跨任务的鲁棒性和多样性。在推理过程中,模型贪婪地选择高值前缀推理步骤,同时根据问题类型选择最优推理头,从而显着提高最终答案的准确性。此外,我们构建了 Reasoning-Tree-160k 数据集并对其进行了两阶段学习。大量实验表明,这种优势引导门控框架有效增强了基准 MLLM 在基于视觉的空间理解和推理任务中的性能。该代码向公众开放供研究:https://github.com/LingLin-ll/Advantage-Guided-Gate。