论文

用于多模态潜在推理的视觉增强深度缩放

Visual Enhanced Depth Scaling for Multimodal Latent Reasoning

模型推理测试时计算扩展

摘要

多模态潜在推理已成为一种有前景的范式,它用隐式特征传播取代显式思想链 (CoT) 解码,同时增强表示信息量并减少推理延迟。通过分析潜在训练期间的 词元级 梯度动态,我们揭示了两个关键观察结果:(1)由于固有的语言偏差,视觉标记表现出比文本对应物明显更小的梯度规范,导致系统性视觉优化不足; (2)语义上简单的标记快速收敛,而复杂的标记则表现出受固定架构深度限制的持续梯度不稳定性。为了解决这些限制,我们提出了一个视觉重放模块和路由深度缩放,以协作增强视觉感知并细化复杂的潜在因素以进行更深入的上下文推理。前一个模块利用因果自注意力来估计标记显着性,通过空间相干约束加强细粒度的基础。作为补充,后一种机制自适应地将额外的推理步骤分配给复杂的标记,从而实现更深入的上下文细化。在逐步将显式 CoT 内化为紧凑的潜在表示的课程策略的指导下,我们的框架在不同的基准上实现了最先进的性能,同时在显式 CoT 基线上提供了显着的推理加速。