MMVistaReason:面向多模态推理的开放数据和后训练方法
MMVistaReason: Toward Open-Data and Post-Training Recipes for Multimodal Reasoning
摘要
开放的多模态推理模型受益于大规模推理监督,但由于数据质量参差不齐、监督构建效率低下、难度不平衡和跨域干扰,可靠的后训练仍然具有挑战性。我们引入了 MMVistaReason (MVR),这是一种开放数据后训练方法,包含三个组成部分:(1) 涵盖互补的分析和现实世界推理组的更广泛的能力覆盖范围,强调结构化推理与视觉感知和空间基础; (2)高效的SFT和RL数据构建,通过分阶段清理和注释标准化异构开放数据,将难度感知级联教师蒸馏与基于答案似然的轨迹选择相结合来构建MVR-SFT-528K,并对MVR-RL-63K应用特定于尺度的前沿过滤; (3)先专业化再整合的训练,训练互补的强化学习专家,并通过多教师在策略蒸馏(MOPD)来巩固他们的能力。我们的分析揭示了监督难度、轨迹质量和模型能力之间依赖于能力的相互作用:较小的学生从选定的监督中受益更多,而较大的学生对轨迹变化和混合域干扰具有鲁棒性。混合域 RL 引入了基准级负迁移,而 MOPD 提供了一致的能力集成,并且首选 KL 方向在不同模型尺度上有所不同。在 15 个多模态基准测试中,MVR-4B 的平均得分为 72.8,优于 Qwen3.5-9B (Instruct) 和 MMFineReason-8B,同时使用的样本比 MMFineReason 少约 70%。缩放到 9B 将平均值提高到 74.4,超过了 Qwen3.5-35B-A3B(指导)。总体而言,MMVistaReason 表明,系统的开放数据构建和容量感知后训练为可靠的多模态推理提供了一条实用且可扩展的路径。