论文
CAST:通过字幕引导的视觉注意力引导减轻大型视觉语言模型中的物体幻觉
CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering
摘要
尽管大视觉语言模型(LVLM)在下游任务中表现出了出色的性能,但它们经常产生偏离视觉信息的内容,导致物体幻觉。为了解决这个问题,最近的工作主要依赖于昂贵的手动注释和训练成本,或显着增加推理时间的解码策略。在这项工作中,我们观察到,与非标题查询相比,在回答标题查询时,LVLM 对视觉信息的注意力显着增强。受这种现象的启发,我们提出了字幕引导的视觉注意力引导(CAST),这是一种 无需训练 即插即用的幻觉缓解方法,它利用与字幕查询相对应的注意力激活模式来增强 LVLM 的视觉感知能力。具体来说,我们使用探测技术来识别对标题查询高度敏感的注意力头,并估计其输出的优化转向方向。这种转向增强了 LVLM 的细粒度视觉感知能力,从而有效减轻物体幻觉。在五个广泛使用的 LVLM 和五个基准(包括判别任务和生成任务)中,CAST 平均将物体幻觉减少了 6.03%,展示了最先进的性能,同时几乎不增加推理成本并保留其他基础功能。