论文

MG-Thinker:双轴自反射多图像推理基础

MG-Thinker: Bi-Axial Self-Reflection for Multi-Image Reasoning Grounding

模型训练强化学习

摘要

强化学习(RL)最近在多模态推理方面取得了巨大进展,为细粒度视觉感知开辟了一条有希望的途径。然而,对于多图像推理基础(MRG),即对现实世界多图像上下文进行像素精确定位的推理,现有的基于强化学习的方法忽略了该范式固有的两个特征:从粗到细的分层推理模式和异构分布的任务样本困难。在这项工作中,我们提出了 MG-Thinker,这是一种训练后 RL 框架,它提出了一种新的 MRG 范式,具有这种分层推理的特点,并由精心策划的 25K MRG 数据集支持,该数据集具有任务自适应思想链 (CoT) 注释,可在得出结论之前引出多视角证据。为了解决异构任务样本困难,我们进一步提出了双轴 DAPO(BiA-DAPO),它通过两种互补机制沿着组内信号轴和组间能力轴分解rollout优势,这两种机制都基于我们为稳定的组级统计定义的候选池。大量实验表明,MG-Thinker 在多图像推理基础上实现了最先进的性能,同时不断提高跨多图像理解和多种多模态基准的泛化能力。