论文

视觉信息引导的扩散多模态并行解码 大语言模型

Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models

模型推理解码与生成控制

摘要

扩散多模态 大语言模型 (dMLLM) 最近已成为多模态生成的新解码范例。从完全屏蔽的序列开始,dMLLM 通过在每一步中揭开剩余屏蔽位置的子集来逐步解码序列。由于所选标记充当后续步骤的预测上下文,因此决定解码哪些标记对于最终输出的质量至关重要。最常见的策略是根据确定性度量来确定词元的优先级,该确定性度量往往倾向于在训练数据中经常观察到的词元。最近的方法而是根据标记对后续预测的影响对标记进行排序,但没有明确考虑输入图像。我们提出了视觉信息引导采样器(VIG-Sampler),它根据对图像标记的关注来对标记进行优先级排序。我们进一步施加一个约束,惩罚图像注意力分布与先前选择的标记相似的候选标记,从而增加解码子集的信息增益。使用 3 个开源 dMLLM 对 7 个字幕和 VQA 基准进行的广泛实验证明了 VIG-Sampler 的有效性,它在字幕基准中比 Info-Gain Sampler 平均高出 19.3 个 CIDEr 点,并且在 COCO Caption 上超越了它,同时只使用了一半的解码步骤。