论文

填补空白:多模态视觉推理的粒度对齐范式 大语言模型

Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

模型推理推理策略与问题分解

摘要

视觉潜在推理让多模态 大语言模型 (MLLM) 创建中间视觉证据作为连续标记,从而避免外部工具或图像生成器。然而,现有的方法通常遵循输出即输入的潜在范式并产生不稳定的增益。我们确定了可能导致这种不稳定的特征空间不匹配的证据:主导视觉潜在模型建立在预规范 MLLM 的基础上,并重用解码器隐藏状态作为预测的潜在输入,即使这些状态占据与模型训练消耗的输入嵌入截然不同的规范机制(Xie 等人,2025;Li 等人,2026;Team 等人,2026)。这种不匹配会使直接潜在反馈变得不可靠。受这一诊断的启发,我们提出了 GAP,一种用于视觉潜在建模的粒度对齐范式。 GAP 在三个级别上对齐视觉潜在推理:特征级对齐通过轻量级 PCA 对齐的潜在头将解码器输出映射到输入兼容的视觉潜在;上下文级别的对齐方式通过可检查的辅助视觉监督来确定潜在目标;能力引导的调整有选择地将潜在监督分配给基础 MLLM 遇到困难的例子。在 Qwen2.5-VL 7B 上,生成的模型在我们的监督变体中实现了最佳平均聚合感知和推理性能。推理时间干预探测进一步表明,生成的潜在变量提供了与任务相关的视觉信号,而不仅仅是添加词元槽。