论文
通过强化学习进行视觉语言模型的基于视觉的自我反思
Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning
摘要
大型视觉语言模型可以通过生成文本思想链 (CoT) 对多模式输入进行推理。 CoT 推理中展示的一个关键能力是自我反思:重新审视之前的决策并纠正之前的错误。然而,现有的 LVLM 通常无法在反射过程中正确处理视觉输入,从而限制了它们将反馈转化为有视觉依据的纠错的能力,尤其是对于分布外的图像。为了解决这个问题,我们提出了一种新颖的强化学习训练框架 VRRL,其中两个组件明确设计用于引发基于视觉的自我反思。首先,我们在训练期间随机屏蔽轨迹前缀,以强调从错误的中间预测中恢复,而不是犯早期错误。其次,我们从经验重放缓冲区中引入缓冲滚入,以使模型暴露于必须学会纠正的各种故障状态。我们评估我们在涉及表格和图表的依赖视觉证据的任务以及空间导航基准方面的方法。虽然现成的模型和传统的微调模型在分布偏移下会大幅退化,但我们的方法通过有效地使用自反射,相对于标准 RL 和面向反射的 微调 基线,显着提高了平均分布外精度。