论文

看到公平,说实话:公平的注意力可以改善基础并减少视觉语言对齐中的幻觉

See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment

模型推理解码与生成控制

摘要

多模态 大语言模型 (MLLM) 经常会产生视觉输入中不存在的物体的幻觉,这通常是因为解码过程中的注意力不成比例地吸引到视觉主导或频繁出现的内容。我们观察到,注意力分配的这种不公平是物体幻觉的根本原因:当稀有的、小的或上下文外围的物体受到足够的关注时,模型无法将其生成置于完整的视觉场景中。我们认为,图像中的每个对象,无论其大小、频率或视觉显着性如何,在解码过程中都应该得到平等的表示机会。为此,我们提出了 DOP-OBC,这是一种基于公平注意力原则的 无需训练 和架构无关的解码策略。两个互补的物体感知信号协同工作:主导物体惩罚(DOP),可以温和地抑制对视觉主导区域的注意力过度集中,以及离群值增强系数(OBC),可以增强对稀有但自信检测到的物体的注意力。这些信号作为因果注意掩模内的每行 logits 调制注入,不需要权重更新并保留自回归解码属性。跨图像和视频 MLLM 的广泛实验表明,在 CHAIR 和 POPE 基准上物体幻觉的持续减少,同时 GPT-4o 在正确性、一致性、细节、上下文和时间维度上评估的字幕质量也得到了改进。 DOP-OBC 确立了注意力分配的公平性不仅仅是一个设计原则,而且是实现更忠实的多模式生成的实用且有效的途径。