论文
MIRL:视觉语言模型的互信息引导强化学习
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
摘要
视觉语言模型 (VLM) 经常出现视觉感知错误和幻觉,从而影响复杂推理任务中答案的准确性。具有可验证奖励的强化学习(RLVR)通过使用答案正确性信号优化策略,提供了一种有前途的解决方案。尽管有效,但流行的 RLVR 方法仍面临两个关键限制。首先,大部分采样预算都浪费在由于早期视觉描述错误而注定失败的轨迹上。其次,稀疏的奖励无法区分失败是源于视觉感知还是推理阶段。我们引入了 MIRL,这是一种解耦框架,它通过利用生成的描述和视觉输入之间的互信息(MI)作为廉价的预筛选信号来解决这两个限制。这使得能够通过分叉将预算分配到高潜力的轨迹,同时解耦训练为视觉感知优化提供独立的基于 MI 的奖励,解决奖励盲目性。对六个视觉语言推理基准的实验表明,MIRL 达到了 70.22% 的平均准确度,并成功超越了仅使用 10 个前样本和前 6 个选择对 16 个完整轨迹进行采样的性能(完整轨迹少了 25%)。我们的代码位于:https://anonymous.4open.science/r/mirl-main/。