论文

一致性作为归纳偏差:学习跨视图不变性以实现稳健的多模态推理

Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning

模型训练强化学习

摘要

归纳偏差通过编码任务结构引导学习走向可推广的解决方案。在这项工作中,我们发现了 MLLM 中一个关键的缺失偏差:跨视图一致性,\textit{i.e.},同一实例的语义不变视图应该导致相同的答案。具有可验证奖励的标准强化学习 (RLVR) 目标不会施加此约束,而是为每个视觉输入分配逐点奖励。即使使用数据增强(DA),转换后的视图通常也是独立奖励的,一旦视图内奖励饱和,就几乎无法提供信号。我们提出了 \textbf{ConsistRoll},这是一种简单但有效的方法,通过重用 GRPO 的分组采样机制将跨视图一致性注入 RLVR 训练中。具体来说,ConsistRoll 将原始且语义不变的变换视图放置在同一生成组中,并且仅当配对完成正确且一致时才分配联合奖励。通过这种方式,ConsistRoll 将一致性转变为在线贡献分配信号,\textbf{没有额外的生成开销和注释}。从理论上讲,我们证明跨视图一致性是一种有效的归纳偏差,并且 ConsistRoll 引入了 DA 中缺少的跨视图校正项,惩罚视图依赖并缓解优势崩溃。数学、通用、幻觉领域的综合基准证实 ConsistRoll 在多模态推理方面取得了强劲的改进。