论文

学习以潜在嵌入混合模态的思维链推理

Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings

模型训练监督微调与指令调优

摘要

我们研究如何把思维链(CoT)扩展到语言之外,以更好地处理多模态推理。虽然CoT帮助LLM与VLM表述中间步骤,但其纯文本形式在视觉密集型问题上常会失败,因为关键中间状态本质上是视觉的。我们引入模态混合CoT,它把文本token与表示为潜在嵌入的紧凑视觉草图交错排列。为在不侵蚀VLM原有知识与能力的前提下弥合模态鸿沟,我们用VLM本身作为编码器,训练语言骨干重建其自身的中间视觉嵌入,以保证视觉潜在空间的语义对齐。我们进一步附加一个基于扩散的潜在解码器,由特殊控制token调用,并以VLM的隐状态为条件。这样,扩散头承载细粒度感知细节,而VLM指明高层意图,从而干净地解耦角色并降低VLM的优化压力。训练分两阶段:先以联合下一token与潜在重建目标,在文本与潜在交错的轨迹上进行监督微调;随后进行强化学习,教会模型何时切换模态以及如何组合长推理链。在11个多样多模态推理任务上的大量实验表明,我们的方法优于纯语言与其他CoT方法。代码将公开发布。

学习以潜在嵌入混合模态的思维链推理
图1:我们提出的方法概览。我们将基于扩散模型的解码器集成到 VLM 中,并训练它学习交错的模态混合 CoT 推理范式。