论文

Faithful-MR1:通过锚定和强化视觉注意力进行忠实的多模态推理

Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

模型训练强化学习

摘要

具有可验证奖励的强化学习 (RLVR) 已成为 大语言模型 中推进复杂推理的有前途的范例,并且最近的工作将 RLVR 扩展到多模态 大语言模型 (MLLM)。然而,这种转移带来了 忠实性 挑战:忠实地感知与任务相关的视觉证据并在推理过程中忠实地使用该证据,导致多模式基准的收益不令人满意。具体来说,现有的感知监督通常对文本描述进行操作,而不是对图像区域进行本地操作,并且忠实的使用在很大程度上被忽视,暴露了感知推理的脱节,即在推理过程中正确感知的证据被丢弃或矛盾。为了弥补这些差距,我们提出了 Faithful-MR1,这是一个训练框架,可以锚定和加强视觉注意力,以解决忠实多模态推理的两部分问题。锚定阶段将感知转变为明确的预推理子任务,直接监督图像区域的专用 <Focus> 标记的注意力,而不是通过文本描述。强化阶段通过反事实图像干预暴露忠实的使用,奖励答案正确的轨迹,将视觉注意力集中在视觉因果关系重要的地方。大量实验表明,Faithful-MR1 在 Qwen2.5-VL-Instruct 3B 和 7B 主干上均优于最新的多模态推理基线,同时使用的训练数据却少得多。