论文
通过全局标准化稳定 同策略 蒸馏 进行 MLLM 推理
Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization
摘要
同策略 蒸馏 (OPD) 最近作为一个重要的 后训练 范例出现。通过使用更强大的教师模型为采样轨迹提供密集、细粒度的监督,OPD 比具有可验证奖励的强化学习 (RLVR) 具有明显的优势,后者通常依赖于稀疏的二元或基于结果的环境反馈。然而,由于离群状态中的幅度未对准,朴素的 词元级 蒸馏 可能会遭受梯度不稳定的影响。为了解决这个问题,我们提出了全局标准化 蒸馏 策略优化(GNDPO),这是一种通过将原始 KL 分数转化为批次级相对优势来稳定优化的实用方法。这种标准化有效地减轻了梯度爆炸,同时保留了 词元级 指导的优点。实验结果表明,GNDPO 显着提高了多模态推理任务的训练鲁棒性和下游性能。代码发布于https://github.com/OPPO-Mente-Lab/GNDPO。