论文
R-C2:循环一致性强化学习提升多模态推理
R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning
摘要
稳健的感知与推理需要跨感官模态的一致性。然而当前多模态模型常常违背这一原则,对同一概念的视觉与文本表示给出相互矛盾的预测。我们不用可能放大系统性偏差的标准投票机制来掩盖这些失败,而是表明跨模态不一致为学习提供了丰富而自然的信号。我们提出RC2,一个通过强制跨模态循环一致性来化解模型内部冲突的强化学习框架。通过要求模型执行反向推理、切换模态,并经由前向推理可靠地重建答案,我们获得了一种密集的、无需标注的奖励。这一循环约束促使模型自主对齐其内部表示。对该结构的优化缓解了模态特有错误,并将推理准确率最高提升7.6个百分点。我们的结果表明,高级推理不仅源于数据规模的扩展,也源于强制模型形成结构一致的世界理解。
