论文
锚定关键信息:面向视觉依据多模态推理的双层学习框架
Anchoring What Matters: A Dual-Level Learning Framework for Visually-Grounded Multimodal Reasoning
摘要
可验证奖励强化学习RLVR显著改善了大型视觉语言模型的推理能力。然而,标准同策略RLVR在保持并增强有视觉依据的推理行为上面临关键优化瓶颈:有价值的轨迹在一次更新后被丢弃,均匀分配token优势又使模型无法强化关键感知或推理步骤。为此,我们提出双层学习框架PIVOT,围绕信息丰富的视觉推理信号锚定策略优化。PIVOT引入自校准经验回放机制,选择性收集并回放具有视觉依据的历史经验,作为策略优化的稳定参考锚点。在此基础上,我们进一步设计视觉引导的优势分配机制,依据token的局部视觉支持及其对后续推理的影响,分配额外的视觉感知优势。跨多种基准的大量实验表明,PIVOT在增强大型视觉语言模型多模态推理能力方面具有很强竞争力。
