论文
CoLT:教授多模态模型通过潜在思想链进行思考
CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts
摘要
思想链 (CoT) 推理使多模态 大语言模型 (MLLM) 能够通过以自然语言生成显式中间推理步骤来处理复杂的视觉推理任务。然而,这种基于文本的推理范式在推理时本质上很慢,甚至有数千个标记,并且从根本上受到自然语言表达能力的限制。在本文中,我们提出了 CoLT(潜在思维链),这是一种新颖的框架,它教导多模态模型通过潜在思维表示链而不是冗长的文本标记进行推理,它只需 3 个步骤即可进行思考。天真地强迫模型用潜在状态进行思考很容易产生无意义的语义并使训练不稳定。为了有效地调节潜在推理过程,我们引入了一种轻量级外部解码器,它在两个互补的方向上为每个潜在推理步骤提供步骤级监督:前向模式将潜在思想解码为下一步的文本推理,后向模式将解码器隐藏状态与给定前面文本上下文的模型的潜在思想对齐。我们进一步纳入内部监督,鼓励连贯的逐步潜在转变。在推理过程中去除了解码器和内部监督,以保持潜在推理的高效率。对八个基准的大量实验表明,CoLT 不仅优于 CODI 和 SIM-CoT 等现有的潜在推理方法,而且还超越了依赖辅助图像且注释要求昂贵的潜在视觉推理方法。与文本 CoT 方法相比,CoLT 可以显着减少 10.1$\times$ 的推理时间和 22.6$\times$ 的文本解码时间。代码发布于 https://github.com/hulianyuyy/CoLT。