论文

MIRROR:从另一个视角学习多模态推理

MIRROR: Learning from the Other View for Multi-Modal Reasoning

模型训练强化学习

摘要

与大语言模型(LLM)的强推理能力不同,视觉语言模型(VLM)在视觉推理上挣扎——甚至在几何题这种拥有等价文本、图形与图形+文本组合视图的问题上。我们证明这些视图常引出不同行为:模型可能从文本解题却在对应图形上失败,或视觉成功而文本失败。这种不一致提示不同视图暴露互补的推理路径与失败模式,而标准多模态后训练未充分利用。为研究并利用该现象,我们构建ODA-Data——一个高质量配对多模态几何数据集:同一问题的文本主导、图像主导与图像+文本组合视图,附训练与评估模态依赖推理行为的划分。随后我们开发模态知情的互惠推理优化(MIRROR),一个经自监督改进多模态推理的强化学习方法:对每个问题,MIRROR在全部视图下评估模型,选表现最佳的视图作教师,以反向KL目标把其他视图向教师训练。在以几何题评估的推理基准上,MIRROR超过标准RL,并在模态间产生更准确、更一致的行为。

MIRROR:从另一个视角学习多模态推理:论文配图
图 1:模态通知交互推理优化 (MIRROR)。 MIRROR 通过选择每个问题中表现最强的观点作为教师,并规范学生对教师分布的较弱观点,从而利用观点不对称性,从而在没有外部监督的情况下提高表现。