论文

保持一致:用一致性约束增强大型视觉语言模型的稳健推理

Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints

模型训练强化学习

摘要

虽然大型视觉语言模型(LVLM)表现出强大的感知能力,但它们在视觉推理任务中仍然很脆弱。现有的基准主要关注符号数学或科学问题以及简单的以视觉为中心的任务,对复杂的视觉推理和逻辑一致性提供有限的评估,而这是可靠推理系统的关键要求。我们引入了 ConVBench,这是一个以视觉为中心的复杂推理基准,其中每个图像都与六个类别中的两个逻辑上等效的问题配对:动作和状态、复杂计数、空间推理、因果和意图理解、常识推理和时间感知。为了补充这个基准,我们定义了两个评估指标:逻辑一致性和稳健准确性,共同评估模型响应的正确性和一致性。我们进一步提出了 ConVLM,它通过基于组相对策略优化 (GRPO) 的强化学习和新颖的一致性奖励来改进 LVLM 推理。该方法利用自动生成的逻辑上等效的问答对和结合基于准确性和一致性的信号的双重奖励设计,鼓励配对响应之间达成一致。无论有或没有严格的答案监督,该框架都能有效运行。