论文

扰乱思想,而不是像素:视觉语言模型强化学习的潜在空间采样轨迹多样化

Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)提高了视觉语言模型(VLM)的推理能力,并且每个优化组内的采样轨迹多样化可以放大其收益。现有的方法通过解码温度或像素空间图像失真而多样化;我们询问扰动是否属于模型的潜在空间。我们引入了噪声对比 GRPO (NC-GRPO),它将尺度校准的高斯噪声注入到每个 rollout 组一半的提示编码通道的最后一个隐藏层,将这些 rollout 从移位的出发状态分支出来。尽管发生位移,仍能到达答案的分支比那些因位移而脱轨的分支得到加强,将分支点的敏感性转化为政策梯度信号;目标、奖励和推理协议保持不变。在使用 Geometry3K 训练的 Qwen2.5-VL-7B 上,NC-GRPO 在五个保留基准(汇集 McNemar $p \le 0.001$)上显着改进了普通 GRPO 的域外数学推理,同时还提高了域内准确性和幻觉鲁棒性——后者是图像空间噪声回归的轴,即使在感知重的基准上发布了更大的 OOD 平均值。机制消融表明,独立的随机多样性,而不是噪音预算或方向,是活性成分,噪音规模研究揭示了推理专业化和一般能力之间的关系。 NC-GRPO 被设计为与模态无关,并集成到标准 RLVR 管道中,作为推理引擎的约 50 行更改。