论文

DAVET:扩散视觉语言模型的去噪感知视觉证据轨迹分配

DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models

模型推理推理加速

摘要

扩散视觉语言模型(dVLM)迭代地对屏蔽响应进行去噪,同时根据视觉证据调节每个去噪步骤,从而使视觉调节成为大量的重复推理成本。与自回归解码不同,随着不确定性的发展,扩散生成会反复重新审视整个响应。我们的分析表明,视觉证据需求强烈依赖于步骤,从而激发了跨降噪步骤的自适应分配。现有的推理加速方法通过解码端策略或通过修剪和合并的视觉词元压缩来运行,但没有明确地将视觉证据视为其需求在扩散过程中不断变化的资源。因此,我们提出了去噪感知视觉证据轨迹分配(DAVET),这是一个 无需训练 框架,可根据不断演变的生成状态分配视觉证据。从相条件证据轨迹开始,所提出的分配策略使用操作需求来设置证据储备,其在每个去噪步骤的分配由轨迹风险调节。 DAVET 通过从单一视觉编码构建的证据视图层次结构来实现最终预算,将何时需要证据以及需要多少证据与证据视图的构建方式分开。在两个具有代表性的 dVLM(LLaDA-V 和 LaViDa)上,通过多个视觉理解基准进行评估,DAVET 实现了 1.55$\times$ 的平均加速,平均相对性能下降 1.86\%,表明去噪感知视觉证据分配可以降低视觉调节成本,同时在很大程度上保持生成质量。