论文

提示、评论家与教师:视觉-语言数学推理中稀疏奖励强化学习的先验注入

Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning

模型训练强化学习RLVR

摘要

用于视觉-语言数学推理的强化学习在稀疏奖励下难以维系:在一个由20,830道视觉数学题构成的题库上,Qwen2-VL-2B仅有3.6%的采样回答正确,85-97%的GRPO采样组完全错误、贡献零梯度。我们在相同条件下、于该机制中训练了十一种方法,每种方法注入一种不同的先验:文本(参考解提示)、分布(来自7B教师的在线策略蒸馏)与价值(带MSE或HL-Gauss分类损失的价值预训练评论家)。先验恰在其被送达时才有帮助:先验有效到达策略的六个实验组与其余五组——无先验基线,以及先验被教师封顶、被门控挡除或因评论家参数化失当而丢失的四个组——在合并的域内指标与跨域迁移(DynaMath)上完全分开、无重叠。然而,核心发现关乎评估:域内题库中的某一片——长期被用作该项目的通用分布检验——与真正的跨域迁移呈负相关(Spearman ρ = -0.74,n = 11个实验组,置换检验 p = 0.011),而域内最难的一片则与跨域迁移高度相关(ρ = +0.89,p < 0.001)。我们将这一反转归因于一个接近随机的多选题子集,它奖励的是“模型没有改变”;透过它来看,跨域最好的方法显得平庸,而最差的反而像冠军。在各方法中,驱动提示收益的是提示引导的探索——而非UFT的辅助损失;将评论家的MSE损失替换为HL-Gauss交叉熵在域内可带来+14.4分。所有准确率均为盲评,并配有配对的精确检验。

提示、评论家与教师:视觉-语言数学推理中稀疏奖励强化学习的先验注入:论文配图
图3:十一个训练臂上评估集之间的Spearman秩相关,由表3中的盲评准确率计算得出。sparse-800 是跨领域准确率的最强预测因子(+0.89);old-319 与之强负相关(−0.74),与 sparse-800 本身也强负相关(−0.66)。合并的域内指标的预测效力机械地来自其中的 sparse-800 成分(该池同时包含两个集合;权重71.5/28.5)。