论文

ST-Veto:经泰勒预测与视觉落地的扩散多模态模型时空token否决

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

模型推理解码与生成控制

摘要

视觉语言模型(VLM)以思维链(CoT)提示取得强推理能力,但带来高昂的顺序生成成本、误差累积与有限的自纠错。扩散多模态大语言模型(dMLLM)以与顺序无关的过程解锁token,提升效率并支持迭代精炼,但其推理机制及增强方法仍待探索。我们提出免训练方法ST-Veto(时空token否决),利用扩散模型每步可观察所有token位置的能力。ST-Veto不只依赖当前步置信度:经置信度动态的二阶泰勒预测否决时间上不稳定的token,并用图像注意力质量过滤弱落地token,将其替换为更安全的候选。跨多个dMLLM与多模态推理基准,ST-Veto持续优于标准解码策略与既往VLM推理方法,在不增加训练或生成成本的前提下把准确率最多提升9%。分析显示ST-Veto把生成引向更高置信、更好落地的路径。

ST-Veto:经泰勒预测与视觉落地的扩散多模态模型时空token否决:论文配图
图 1:我们的工作概述。基本解码器根据当前步置信度揭开标记,而 ST-Veto 在将标记提交到去噪轨迹之前应用时间稳定性和视觉基础检查。