论文
响应时保持忠实:为视觉语言模型强化学习返回流畅且落地的答案
Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning
摘要
强化学习(RL)是提升视觉语言模型(VLM)推理能力的重要范式。但直接对rollout多模态推理应用RL可能不稳定——由于利用语言先验、忽视视觉证据、生成流畅但无视觉落地的推理轨迹。问题 arises:能否在应用RL之前先把策略引导向视觉忠实的推理regime?为此我们提出忠实热启动(FWS)策略:先从六个通用VQA基准策展具有显式视觉-语言因果关系的样本构建FaithfulQA数据集——每对图像-问题获得一定程度视觉观察、问题要求、常识知识、领域知识与最终答案。随后以VLM裁判进一步净化数据集,确保强因果一致性与视觉忠实性。该热启动阶段在后续稀疏答案级奖励下的RL优化之前,为模型配备理解因果落地的视觉-语言模式的能力。实验结果展示忠实监督改善答案准确率、稳定RL训练并减少无视觉支撑的推理。
