论文
Thinking with Deltas:通过差分视觉推理策略激励强化学习
Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
摘要
可验证奖励强化学习(RLVR)显著提升了大语言模型的推理能力。然而,将RLVR适配到多模态领域存在一个关键的感知—推理解耦问题。现有范式以文本中心的结果奖励驱动、以语言媒介进行推理,无意中鼓励模型绕过视觉感知。我们通过盲测实验实证验证了这一点:即使完全移除视觉输入,最先进的策略仍能保持甚至出人意料地提升性能。这表明这些模型退化为盲推理者(blind reasoners),利用语言先验生成看似合理的答案,而不是关注视觉证据。为此,我们提出Thinking with Deltas,一个由差分视觉推理策略(DVRP)驱动的框架。DVRP通过由原始、遮蔽与扰动输入构成的视觉三元组引入内在监督。它优化模型以最大化与遮蔽输入的推理差异(强制视觉敏感性),同时最小化与扰动输入的推理差异(确保视觉鲁棒性)。通过将推理变化严格与视觉信息的Delta对齐,DVRP从根本上增强了视觉理解能力,并在通用与医学基准上显著超越最先进方法,且无需外部标注或辅助工具。
