论文
洞察地面:抗幻觉 MDLLM 的视觉注意力
Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs
摘要
多模态扩散 大语言模型 (MDLLM) 通过并行掩码解码实现高并发生成,但该架构仍然容易出现多模态幻觉。这种结构漏洞源于算法缺陷:解码器根据文本可能性对候选标记进行排名,而不验证本地化的视觉支持。我们确定,这种仅语言的排名会导致客观不匹配,其中语言概率质量充当预期多模式任务的错误指定代理。因此,我们将幻觉重新解释为局部优化错误,这是一种解码器利用语言快捷方式以牺牲视觉基础为代价来最大化代理分数的现象。为了解决这种目标不匹配的问题,我们引入了 VISAGE,这是一种 无需训练 解码框架,可以在推理时校准目标。 VISAGE 通过量化交叉注意力分布的空间熵来估计代理差异。通过在注意力头之间强制达成本地化共识,该方法对空间均匀分布进行惩罚,并对词元承诺进行重新排序,以支持基于视觉的结果。我们提供分析稳定性保证,确定 VISAGE 在估计误差下保持有限的客观损失。对幻觉敏感和通用基准的评估证明了该框架的稳健性,在 MMMU-val 上获得了 8.59% 的相对收益,在 HallusionBench 上获得了 7.75% 的相对收益。