论文

锚定关键信息:面向视觉依据多模态推理的双层学习框架

Anchoring What Matters: A Dual-Level Learning Framework for Visually-Grounded Multimodal Reasoning

模型训练强化学习RLVR

摘要

可验证奖励强化学习RLVR显著改善了大型视觉语言模型的推理能力。然而,标准同策略RLVR在保持并增强有视觉依据的推理行为上面临关键优化瓶颈:有价值的轨迹在一次更新后被丢弃,均匀分配token优势又使模型无法强化关键感知或推理步骤。为此,我们提出双层学习框架PIVOT,围绕信息丰富的视觉推理信号锚定策略优化。PIVOT引入自校准经验回放机制,选择性收集并回放具有视觉依据的历史经验,作为策略优化的稳定参考锚点。在此基础上,我们进一步设计视觉引导的优势分配机制,依据token的局部视觉支持及其对后续推理的影响,分配额外的视觉感知优势。跨多种基准的大量实验表明,PIVOT在增强大型视觉语言模型多模态推理能力方面具有很强竞争力。

锚定关键信息:面向视觉依据多模态推理的双层学习框架:论文配图
图 1:PIVOT 框架概述。标准 RLVR 由两个协同模块增强:(1)自校准体验重放模块选择性地收集和重放有价值的提示以及高质量的体验,以通过自校准损失指导策略优化; (2)视觉引导优势分配模块通过将局部反事实视觉支持与熵门控未来影响相结合来分配令牌优势,以强化关键感知或推理步骤。