论文

ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维

ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

模型训练监督微调与指令调优

摘要

多模态 大语言模型 (MLLM) 已经取得了显着的进步,但仍然难以应对需要多步感知和逻辑演绎的复杂视觉推理任务。虽然显式视觉生成会产生高昂的计算成本,但现有的潜在方法通常依赖于外部专家或缺乏严格的认知逻辑。在本文中,我们介绍了 ProLaViT(渐进式潜在视觉思维),这是一个使 MLLM 能够在连续潜在空间中执行结构化视觉推导的框架。与依赖于异构外部模型的作品不同,ProLaViT 利用内源性的自我 蒸馏 机制,利用模型自己的视觉编码器来监督潜在的想法。为了实现这一点,我们构建了一个可扩展的编程合成管道,使模型能够在没有推理时间工具的情况下内化算法精度。我们设计了两种推理范式:(1)用于空间任务的从粗到细的因果链,引导注意力从全局背景到局部目标。 (2)逻辑任务的辩证推理链,融入反事实思维进行验证。此外,我们提出了距离加权多样性损失来施加拓扑感知约束,通过强制语义独特性来防止特征退化。大量实验表明,ProLaViT 在以视觉为中心的基准测试中优于基准,以高效率实现卓越的准确性和可解释性。