论文
ST-Veto:经泰勒预测与视觉落地的扩散多模态模型时空token否决
ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding
摘要
视觉语言模型(VLM)以思维链(CoT)提示取得强推理能力,但带来高昂的顺序生成成本、误差累积与有限的自纠错。扩散多模态大语言模型(dMLLM)以与顺序无关的过程解锁token,提升效率并支持迭代精炼,但其推理机制及增强方法仍待探索。我们提出免训练方法ST-Veto(时空token否决),利用扩散模型每步可观察所有token位置的能力。ST-Veto不只依赖当前步置信度:经置信度动态的二阶泰勒预测否决时间上不稳定的token,并用图像注意力质量过滤弱落地token,将其替换为更安全的候选。跨多个dMLLM与多模态推理基准,ST-Veto持续优于标准解码策略与既往VLM推理方法,在不增加训练或生成成本的前提下把准确率最多提升9%。分析显示ST-Veto把生成引向更高置信、更好落地的路径。
