论文

基于扩散的多模态的视觉冗余控制并行解码 大语言模型

Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models

模型推理解码与生成控制

摘要

基于扩散的多模态 大语言模型 (dMLLM) 通过并行迭代预测多个屏蔽位置的标记进行解码。这将每个解码步骤变成了位置选择问题:模型不仅必须选择哪些预测单独可靠,而且还必须选择哪些位置应该一起提交作为后续解码步骤的上下文。现有的基于置信度的解码独立对屏蔽位置进行排名并提交前 K 个位置,很大程度上忽略了提交的标记是否提供补充的视觉基础。我们确定了该策略在多模态设置中的步骤级限制:在同一步骤中选择的高置信度词元可能依赖于重叠的视觉基础,在提交的词元之间引入视觉冗余,并为以后的解码留下较少的互补视觉基础。为了量化这种影响,我们引入了视觉冗余指数(VRI),它测量并行提交的词元之间的视觉基础重叠。为了在解码过程中控制这种冗余,我们提出了视觉冗余控制解码(VRCD),这是一种 无需训练 推理时间解码方法,它使用标记到图像的注意力来优先考虑视觉互补位置。在不同的多模式基准测试中,VRCD 以适度的运行时开销减少了视觉冗余和剩余位置熵。在较长的解码实验中,与基于置信度的解码相比,它在 M^3CoT 上的相对准确率提高了 18.8%,在 MMBench 上提高了 6.9%。代码可在 https://github.com/infiniteYuanyl/VRCD 获取。