论文

多模态注意力的潮汐:为落地VLM推理调度视觉中继窗口

The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning

模型推理解码与生成控制

摘要

视觉语言模型在多模态推理基准上日益成功,但其视觉证据一旦进入语言栈常变得不稳定——削弱证据落地的推理。为理解这种脆弱性,我们经机制视角考察VLM内部动力学,发现跨深度的多模态注意力焦点存在稳定的三阶段再分配:早期的按问题组织的组织阶段、关键的中间视觉主导中继阶段、晚期的回归答案形成阶段。我们把中间阶段操作化为视觉中继窗口(VRW),并显示其几何随任务需求变化、与落地生成因果相联、并能把无支撑答案与更强的推理轨迹区分开。受这一内部节奏引导,我们提出TRACE:一个带轻量训练模块的任务自适应推理时控制框架——在prefill期间重塑中继分配、在解码期间保持交接后已组装的视觉支撑。跨四个开放权重VLM底座与七个基准:TRACE在落地敏感设定上取得大幅增益——平均提升4.33分、最高6.6分,同时改善推理重的任务。结果表明显式控制跨深度的多模态焦点,为强化证据落地的多模态推理提供统一有效机制。

多模态注意力的潮汐:为落地VLM推理调度视觉中继窗口:论文配图
图 1:跨视觉语言模型的统一三阶段中继模式。在十个开放的 VLM 中,联合归一化的答案→查询和图像→图像轨迹显示了多模态焦点的一致的深度重新分布:早期层强调问题条件响应组织,中间层将计算分配给视觉整合,后面的层转向答案形成。水平括号标记接力间隔,而成对标记将各个模型与其轨迹相匹配。