论文

功劳归其应得:跨模态连接性驱动MLLM推理的精准强化学习

Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)显著推进了多模态大语言模型(MLLM)的推理能力,但视觉证据在推理过程中如何被整合仍知之甚少。我们从跨模态注意力连接性的视角考察多模态RLVR,发现只有一小部分token(约15%)表现出强视觉-文本耦合。这些高连接性token充当锚点,将推理扎根于图像,而其余多数token遵循语言模式。在RLVR训练过程中,贡献归因自然集中于这些锚点,并随时间不断锐化其视觉扎根。基于这一洞察,我们提出锚点token强化学习(Anchor-Token Reinforcement Learning,AT-RL),一个轻量级框架,通过对注意力拓扑进行基于图的聚类来选择性地强化高连接性token。在3B-32B系列上的评估显示,AT-RL仅引入1.2%的开销,便使32B模型在MathVista(80.2)上超越72B-Instruct基线,并在STEM、视频与通用任务上取得一致增益。相反,仅在低连接性token上训练会导致严重退化,证实有效的多模态RL有赖于对视觉锚点的精准贡献归因。我们的工作揭示,推理质量并非由token数量决定,而是由跨模态锚定的保真度决定。

功劳归其应得:跨模态连接性驱动MLLM推理的精准强化学习
图2:锚定 Token 强化学习(Anchor-Token Reinforcement Learning,AT-RL)框架概览。我们的方法通过三阶段的连接性感知分析来细化强化信号:(i) 定位锚点(Locating Anchors):从 MLLM 中提取跨模态注意力足迹并施加去偏置,以识别关键感知 token;(ii) Token 分组(Token Grouping):基于注意力相似度构建功能依赖图,并通过 METIS 算法将其划分为语义簇 { C k } \{C_{k}\} ;(iii) 信用分配(Credit Assignment):量化簇级重要性 W ⁡ ( C k ) W(C_{k}) ,对基础优势 A i A^{i} 进行软加权。最终调制得到的优势 A A ​ T ( i , t ) A_{AT}^{(i,t)} 确保策略梯度优先作用于对视觉定位(visual grounding)至关重要的 token,同时保持推理链的逻辑连贯性。