论文

看得更远,思考得更深入:通过低级视觉提示和反思提高 VLM 的推理能力

See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

模型训练强化学习

摘要

视觉语言模型 (VLM) 的最新进展受益于增强推理的强化学习 (RL)。然而,现有方法仍然面临严重的局限性,包括缺乏低级视觉信息和有效的视觉反馈。为了解决这些问题,本文提出了一个统一的多模态交错推理框架\textbf{ForeSight},该框架使VLM能够通过低级视觉提示进行\textbf{See Fury},并通过有效的视觉反馈进行\textbf{Think Deeper}。首先,它引入了一套低级视觉工具,将必要的视觉信息整合到推理链中,减轻对细粒度视觉特征的忽视。其次,详细阐述了基于掩模的视觉反馈机制,将视觉反射纳入思维过程,使模型能够动态地重新检查和更新其答案。在强化学习的驱动下,ForeSight 学会自主决定工具调用和答案验证,并以最终答案的准确性作为奖励信号。为了评估所提出框架的性能,我们基于 SalBench 数据集构建了一个新的数据集:Character and Grounding SalBench (CG-SalBench)。实验结果表明,ForeSight-7B模型显着优于相同参数规模的其他模型,甚至在某些指标上超越了当前的SOTA闭源模型。