论文
超越 SFT 到 RL:通过 Black-Box 同策略 蒸馏 进行多模态 RL 预对准
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
摘要
大型多模式模型 (LMM) 的标准 后训练 配方将监督 微调 (SFT) 应用于策划的演示,然后进行具有可验证奖励的强化学习 (RLVR)。然而,SFT 引入了分布漂移,既不保留模型的原始功能,也不忠实地匹配监督分布。这个问题在多模态推理中被进一步放大,其中感知错误和推理失败遵循不同的漂移模式,并在随后的强化学习过程中复合。我们引入了 PRISM,这是一种三级管道,通过在 SFT 和 RLVR 之间插入显式分布对齐阶段来减轻这种漂移。基于 同策略 蒸馏 (OPD) 的原理,PRISM 将策略与具有专门感知和推理专家的混合专家 (MoE) 判别器之间的黑盒、响应级对抗性游戏结合起来,提供解开的纠正信号,引导策略走向监督分布,而无需访问教师 logits。虽然 126 万次公开演示足以进行广泛的 SFT 初始化,但分布对齐需要更高保真度的监督;因此,我们策划了来自 Gemini 3 Flash 的 113,000 个额外演示,具有密集的视觉基础和对最难解决的问题的逐步推理。 Qwen3-VL 上的实验表明,PRISM 在多种 RL 算法(GRPO、DAPO、GSPO)和多种多模态基准上持续提高了下游 RLVR 性能,在 4B 和 8B 上分别比 SFT 到 RLVR 基线提高了平均精度 +4.4 和 +6.0 点。我们的代码、数据和模型检查点可在 https://github.com/XIAO4579/PRISM 上公开获取。