论文

iVGR:通过强化学习将 MLLM 的视觉推理内化

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

模型训练强化学习

摘要

虽然基于视觉的思维链 (CoT) 已成为增强多模态 大语言模型 (MLLM) 细粒度感知的有前途的范例,但其在推理阶段的功效仍未得到充分探索。在这项工作中,我们凭经验发现,与标准文本 CoT 相比,在推理过程中在视觉基础 CoT 中强制使用显式对象框通常会降低性能,而标准文本 CoT 则没有显式视觉基础进行推理。我们假设视觉定位能力可以内化到文本 CoT 中,并且强制性的显式基础会对模型的答案预测的主要目标带来不必要的干扰。为了解决这个问题,我们提出了内部化视觉基础推理(\textbf{iVGR}),这是一种新颖的强化学习框架,可将本地化能力转移到文本推理过程中。我们采用双流训练策略,其中文本流通过提议的一致性奖励与高质量视觉基础流对齐,使模型能够在推理过程中准确定位,而无需明确的基础。大量实验表明,我们的方法在细粒度基准测试上显着优于现有基准,同时保持支持工具辅助推理工作流程的灵活性。