论文

响应时保持忠实:为视觉语言模型强化学习返回流畅且落地的答案

Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning

模型训练合成数据

摘要

强化学习(RL)是提升视觉语言模型(VLM)推理能力的重要范式。但直接对rollout多模态推理应用RL可能不稳定——由于利用语言先验、忽视视觉证据、生成流畅但无视觉落地的推理轨迹。问题 arises:能否在应用RL之前先把策略引导向视觉忠实的推理regime?为此我们提出忠实热启动(FWS)策略:先从六个通用VQA基准策展具有显式视觉-语言因果关系的样本构建FaithfulQA数据集——每对图像-问题获得一定程度视觉观察、问题要求、常识知识、领域知识与最终答案。随后以VLM裁判进一步净化数据集,确保强因果一致性与视觉忠实性。该热启动阶段在后续稀疏答案级奖励下的RL优化之前,为模型配备理解因果落地的视觉-语言模式的能力。实验结果展示忠实监督改善答案准确率、稳定RL训练并减少无视觉支撑的推理。

响应时保持忠实:为视觉语言模型强化学习返回流畅且落地的答案:论文配图
图 1:拟议的忠实工作流程策略 (FWS) 的流程。直接推出通常缺乏视觉基础,导致高度自信但错误的输出。 FWS 通过引出忠实的推理痕迹来解决这个问题。认识到标准 VQA 三元组通常无法传达视觉和语言之间真正的因果效应,FWS 筛选了六个基准来过滤掉因果关系较弱的数据,组成了 FaithfulQA 数据集(①∼\sim④)。经过四个阶段的忠实痕迹引出后,高级 VLM 判断者会在 SFT 期间根据这些痕迹对视觉证据的因果依赖性来评估和细化这些痕迹。由此产生的高置信度、可靠的数据集可防止 VLM 在后续 RL 训练过程中陷入退化推理。