论文
多模态注意力的潮汐:为落地VLM推理调度视觉中继窗口
The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning
摘要
视觉语言模型在多模态推理基准上日益成功,但其视觉证据一旦进入语言栈常变得不稳定——削弱证据落地的推理。为理解这种脆弱性,我们经机制视角考察VLM内部动力学,发现跨深度的多模态注意力焦点存在稳定的三阶段再分配:早期的按问题组织的组织阶段、关键的中间视觉主导中继阶段、晚期的回归答案形成阶段。我们把中间阶段操作化为视觉中继窗口(VRW),并显示其几何随任务需求变化、与落地生成因果相联、并能把无支撑答案与更强的推理轨迹区分开。受这一内部节奏引导,我们提出TRACE:一个带轻量训练模块的任务自适应推理时控制框架——在prefill期间重塑中继分配、在解码期间保持交接后已组装的视觉支撑。跨四个开放权重VLM底座与七个基准:TRACE在落地敏感设定上取得大幅增益——平均提升4.33分、最高6.6分,同时改善推理重的任务。结果表明显式控制跨深度的多模态焦点,为强化证据落地的多模态推理提供统一有效机制。
