论文

Thinking Diffusion:在扩散多模态语言模型中惩罚并引导视觉依据对齐推理

Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

模型推理解码与生成控制

摘要

扩散大语言模型(dLLM)正成为自回归(AR)大语言模型的有力替代方案。近来,这一范式已被扩展到多模态任务,催生了扩散多模态大语言模型(dMLLM)。这类模型有望在保留大语言模型推理能力的同时,通过并行生成实现更快的推理。然而,与思维链(CoT)推理结合时,dMLLM暴露出两个关键问题。首先,我们观察到dMLLM往往在非常早期的时间步就生成最终答案token。这一趋势表明模型在充分推理之前就已确定答案,导致推理性能下降。其次,在初始时间步,dMLLM对视觉提示的依赖极小,其视觉信息利用模式与AR视觉语言模型存在根本差异。总而言之,这些发现表明dMLLM倾向于在未充分依据视觉输入的情况下过早生成最终答案。为解决这些局限,我们提出位置与步惩罚(PSP)和视觉推理引导(VRG)。PSP在早期时间步对靠后位置的token施加惩罚,延迟过早的答案生成,并鼓励跨时间步的渐进式推理。VRG受无分类器引导(classifier-free guidance)启发,放大视觉证据信号,增强模型与视觉证据的对齐。在多种dMLLM上的大量实验表明,我们的方法在精度上最高提升7.5%,同时相比使用四倍扩散步数进行推理的方式实现超过3倍的加速。

Thinking Diffusion:在扩散多模态语言模型中惩罚并引导视觉接地推理:论文配图
图 1:LaViDa 的响应示例(生成长度 = 64,扩散步骤 = 32)。答案生成时的状态是指生成最终答案(A、B、C)时的输出状态,而最终响应表示每种方法生成的模型的最终响应。