论文

生成作为辅助监督:通过解耦嵌入预测以零推理开销增强视觉理解

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

模型训练预训练

摘要

虽然多模态 大语言模型 (MLLM) 取得了显着的进步,但视觉理解和生成通常被视为不同的目标。现有的统一框架通常依赖于离散的视觉标记化或扩散目标,其生成目标与视觉理解模型消耗的连续表示不同,这使得直接迁移以增强现有的预训练 MLLM 变得非常重要。在这项工作中,我们提出了 GAS,一种生成引导的训练框架,它将视觉生成重新解释为表示学习的辅助监督。具体来说,GAS 采用下一个嵌入预测 (NEP) 作为解耦 Mixture-of-Transformer (MoT) 架构中的跨模式生成范例。通过维持共享的下主干和平行的上层,GAS 让生成损失以更精细的空间精度和更强的视觉保留丰富共享视觉路径,同时保护上层理解层免受直接生成梯度的影响。为了最大限度地发挥这种协同作用,我们进一步构建了高度相关的生成任务,这些任务需要深厚的认知基础,而不是单独的通用合成。在模型尺度和训练阶段,GAS 提高了总体多模态理解,在感知和空间理解方面具有最可靠的收益。至关重要的是,由于辅助生成分支在训练后被丢弃,因此这些增益会导致零推理开销。广泛的受控比较和表征水平分析进一步阐明了生成引导训练何时以及为何有益于理解,并证明了生成引导训练作为增强多模式理解的实用途径的可行性。