论文
减轻大型扩散视觉语言模型中的掩模先验漂移和位置注意力崩溃
Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models
摘要
大型扩散视觉语言模型(LDVLM)最近已成为自回归模型的一种有前景的替代方案,可以实现并行解码以实现高效推理,并利用全局上下文的双向注意力。尽管取得了这些进步,但它们在长形式生成下的行为仍未得到充分研究。在这项工作中,我们展示了现有的 LDVLM 遭受重复生成和视觉基础退化的问题,并确定了两个根本原因。首先,重复生成源于掩码词元先验:由于生成词元被初始化为掩码词元,因此它们的隐藏表示在生成步骤中逐渐向共享先验方向漂移。其次,位置注意力偏差和迭代揭露过程之间的根本失调抑制了对信息丰富的视觉标记的注意力,从而降低了视觉基础。基于这些见解,我们提出了一种 无需训练 方法,引入掩模先验抑制和单调 RoPE 缩放,以减轻解码过程中掩模先验漂移和位置注意力崩溃。对一般多模态基准和视觉基础任务的实验表明,相对于基线 LDVLM 有所改进,在长格式描述基准上有显着的提升。我们的结果表明,可以通过轻量级、即插即用策略有效解决这些故障,该策略不需要额外的训练,并且可以在不同的 LDVLM 架构中推广。