论文

熵不够:为视觉RLVR解锁有效强化学习

Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection

模型训练强化学习RLVR

摘要

虽然词元级熵通常被认为对于具有可验证奖励的纯文本强化学习(RLVR)中的贡献分配有效,但目前尚不清楚这种机制是否仍然适用于视觉推理。我们的对照研究表明,由于遗漏了具有自然低熵的视觉敏感标记,这种机制在视觉推理中崩溃了。尽管现有的多模态强化学习方法越来越认识到视觉感知的重要性,但它们很难满足将精确感知基础与语义推理交织在一起的内在需求,要么缺乏系统的视觉测量,要么忽视了词元熵主要驱动语义探索。为了解决这个问题,我们引入了 VEPO(用于策略优化的视觉熵词元选择),这是一种有效的 RL 框架,通过有原则的乘法耦合将视觉敏感性与词元熵显式集成,其中 VEPO 将梯度信用重定向到同时具有视觉基础和信息丰富的词元。大量实验证明了 VEPO 的领先性能,在 7B 尺度上显着优于仅熵基线 2.28 点,在 3B 尺度上显着优于仅熵基线 3.15 点。消融进一步证实了我们方法的合理性。

熵不够:为视觉RLVR解锁有效强化学习:论文配图
图 3:主要训练流程。 VEPO 使用受噪声扰动的图像执行反事实前向传递,并通过乘法耦合两个互补信号来量化令牌级视觉依赖性:JSD 和 |𝚫​𝑯𝒕|\bm{|\Delta H_{t}|},然后使用令牌熵进行调制,以同时进行视觉基础和信息优化。详细算法见附录一。