论文
DyCo-RL:用于视觉推理的动态跨模态协调
DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning
摘要
具有可验证奖励的强化学习 (RLVR) 已成为增强多模态 大语言模型 (MLLM) 视觉推理的领先范例。然而,现有的 RLVR 方法主要针对推理结果进行优化,而忽略了该结果是如何产生的:随着思想链的展开,一些标记必须从图像中提取证据,而其他标记必须锚定到前面的文本上下文,但单个序列级奖励无法提供关于每个标记是否利用其角色所需的模式的信号。 词元级 分析和受控干预表明,词元经常未能完整注意力其指定的模式,并且这种协调故障可能会导致推理失败。受这些发现的启发,我们提出了 DyCo-RL,它将动态跨模式协调集成到 RLVR 优化中。具体来说,DyCo-RL 使用 Fisher-Rao 测地距离来测量模态内注意力转移,将标记分配给面向视觉或面向文本的功能角色。然后,它评估词元的实际注意力分配与其分配的角色之间的一致性,利用该分数在策略优化期间进行对齐引导的优势重新加权。使用 11K 个 RL 训练示例进行的大量实验表明,与算法无关的 DyCo-RL 在应用于 Qwen2.5-VL-3B/7B 和 Qwen3.5-27B 时,可以提高所有四种评估的 RLVR 算法在涵盖以视觉为中心和数学推理的七个基准中的平均性能。