论文

Thinking with Deltas:通过差分视觉推理策略激励强化学习

Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)显著提升了大语言模型的推理能力。然而,将RLVR适配到多模态领域存在一个关键的感知—推理解耦问题。现有范式以文本中心的结果奖励驱动、以语言媒介进行推理,无意中鼓励模型绕过视觉感知。我们通过盲测实验实证验证了这一点:即使完全移除视觉输入,最先进的策略仍能保持甚至出人意料地提升性能。这表明这些模型退化为盲推理者(blind reasoners),利用语言先验生成看似合理的答案,而不是关注视觉证据。为此,我们提出Thinking with Deltas,一个由差分视觉推理策略(DVRP)驱动的框架。DVRP通过由原始、遮蔽与扰动输入构成的视觉三元组引入内在监督。它优化模型以最大化与遮蔽输入的推理差异(强制视觉敏感性),同时最小化与扰动输入的推理差异(确保视觉鲁棒性)。通过将推理变化严格与视觉信息的Delta对齐,DVRP从根本上增强了视觉理解能力,并在通用与医学基准上显著超越最先进方法,且无需外部标注或辅助工具。

Thinking with Deltas:通过差分视觉推理策略激励强化学习 配图
图 2:DVRP 框架。我们的方法通过视觉三元组对比学习目标弥合感知-推理之间的解耦。上方分支表示标准的推理 rollout。下方分支强制施加两个关键的视觉属性:(1) 视觉鲁棒性:最小化原始输入与噪声扰动输入(+Δ)上预测之间的 KL 散度(KL_noise);(2) 视觉敏感性:当关键视觉语义被遮挡(−Δ)时最大化散度(KL_mask)。熵正则化项 ℋ 防止分布坍缩。