论文

迈向可扩展的 RLVR:数据合成和蒸馏后的多模式指令

Towards Scalable RLVR: Multimodal Instruction Following Data Synthesis and Distillation

模型训练合成数据

摘要

多模式指令遵循(MMIF)对于构建多面手智能体至关重要。然而,当前的训练范例严重依赖监督微调(SFT),这通常会导致表面级模式匹配并降低一般能力。虽然具有可验证奖励的强化学习 (RLVR) 提供了一种有前途的替代方案,但由于缺乏高质量、支持 RL 的多模态数据,其在 MMIF 中的可扩展性受到严重瓶颈。为了弥补这一差距,我们提出了 MIFS(\textbf{M}ultimodal \textbf{I}nstruction \textbf{F}ollowing \textbf{S}ynthesis),这是一个旨在生成 RL 就绪多模态数据的系统管道。具体来说,MIFS 引入了生成约束协议来合成不同的原始样本,然后是可学习性感知的蒸馏机制,该机制基于 RL 训练动态来过滤数据,以确保稳定的策略优化。此外,基于代码的验证器为策略学习提供高精度奖励信号。生成的数据集包含跨 8 个约束类别和 14 个任务域的 90k 个样本。实证评估表明,与使用原始数据相比,经过 MIFS 训练的 MLLM 在四个 MMIF 基准上平均提高了 8.13%,训练收敛速度提高了 3 倍。至关重要的是,我们的方法减轻了 SFT 典型的泛化权衡,保留了核心视觉功能,同时显着提高了指令跟踪精度。