论文

看到更多就意味着了解更多吗?多源视觉推理的单锚定优势归一化

Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning

模型训练强化学习

摘要

通过具有可验​​证奖励的强化学习(RLVR)进行视觉推理已经取得了显着的进展。然而,在处理多源输入时,现有方法往往将其视为纯粹的信息积累,缺乏明确的机制来区分整合额外源是否会产生信息增益或引入干扰。因此,在集成多个源时,他们很难有效地模拟动态交互,特别是当它们在物理属性和语义(例如红外和深度)方面存在显着差异时,导致当某个源拥有主导信号时,其性能低于单源推理。为了解决这个问题,我们提出了 MARS,一种新颖的单锚定多源推理框架,它将每种视觉模态建模为独立的信息源。具体来说,通过将单源奖励视为动态锚点,我们的方法明确地将多源融合引入的信息增益纳入优势归一化中,并自适应地强调源之间的相互促进,同时抑制 RLVR 期间潜在的噪声或冲突。从理论分析来看,我们的方法有效地量化了梯度估计中多源集成引入的信息增益,从而实现了一致的模态调节。实证结果还显示,GRPO 和 DAPO 在不同数据集上的性能提升了 3.2% 和 4.9%,这证实了我们方法的有效性。