论文
放松锚框优势以减轻视频中的幻觉 大语言模型
Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models
摘要
最近的视频大语言模型(Video-LLM)表现出了很强的视频理解能力,但他们仍然患有幻觉。现有的缓解方法通常依赖于训练、输入修改、辅助指导或额外的解码程序,而在很大程度上忽视了更根本的挑战。在生成过程中,Video-LLM 倾向于过度依赖时间证据的有限部分,导致视频中证据聚合的时间不平衡。为了解决这个问题,我们研究了解码器端现象,其中模型表现出时间上不平衡的浓度模式。我们将具有最高聚合帧级注意力质量的帧称为锚帧。我们发现这种偏差在很大程度上独立于输入视频,相反似乎反映了持久的、特定于模型的结构或位置偏差,其过度主导与容易产生幻觉密切相关。受这一见解的启发,我们提出了解码器端时间重新平衡(DTR),这是一种 无需训练 层选择性推理方法,可重新平衡中后期解码器层中的时间证据分配,而无需改变视觉编码或需要辅助模型。 DTR 自适应地校准解码器端视觉注意力,以缓解时间上不平衡的注意力,并鼓励关注不足的帧更有效地促进响应生成。通过这种方式,DTR 引导解码器将其输出置于时间上更广泛、更平衡的视频证据中。关于幻觉和视频理解基准的大量实验表明,DTR 持续提高了不同 Video-LLM 系列的幻觉鲁棒性,同时保持有竞争力的视频理解性能和高推理效率。