论文
功劳归其应得:跨模态连接性驱动MLLM推理的精准强化学习
Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning
摘要
可验证奖励强化学习(RLVR)显著推进了多模态大语言模型(MLLM)的推理能力,但视觉证据在推理过程中如何被整合仍知之甚少。我们从跨模态注意力连接性的视角考察多模态RLVR,发现只有一小部分token(约15%)表现出强视觉-文本耦合。这些高连接性token充当锚点,将推理扎根于图像,而其余多数token遵循语言模式。在RLVR训练过程中,贡献归因自然集中于这些锚点,并随时间不断锐化其视觉扎根。基于这一洞察,我们提出锚点token强化学习(Anchor-Token Reinforcement Learning,AT-RL),一个轻量级框架,通过对注意力拓扑进行基于图的聚类来选择性地强化高连接性token。在3B-32B系列上的评估显示,AT-RL仅引入1.2%的开销,便使32B模型在MathVista(80.2)上超越72B-Instruct基线,并在STEM、视频与通用任务上取得一致增益。相反,仅在低连接性token上训练会导致严重退化,证实有效的多模态RL有赖于对视觉锚点的精准贡献归因。我们的工作揭示,推理质量并非由token数量决定,而是由跨模态锚定的保真度决定。
