论文

VADER:视频中用于减轻幻觉的自适应去偏 大语言模型

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

模型推理解码与生成控制

摘要

大型视觉语言模型(LVLM)在开放式视频理解方面表现出了强大的性能,但在没有视频证据支持的情况下,它们仍然容易做出流畅的反应。现有的 无需训练 方法通常应用全局固定的视觉干预或通过输入扰动构建对比分支。前者不能适应视频相关的融合路径,而后者可以通过跨帧冗余来补偿。因此,我们提出通过证据重新加权进行视频自适应去偏(VADER),这是一个具有两个互补模块的 无需训练 框架。视觉焦点重新分配 (VFR) 自动实例化每个视频问题输入的干预策略:它诊断逐层视觉到文本的证据流,确定干预位置,并导出将前 softmax 注意力从系统词元重新分配到视频词元块的强度。选择性证据擦除 (SEE) 独立地屏蔽每个帧中的高重要性视觉标记,构建难以通过相邻帧进行补偿的先验偏差分支。然后,对比解码会降低在选择性证据删除后仍然有信心的预测的权重。在多个 VideoLLM 中,VADER 在事件级基础和时间一致性方面取得了重大改进;在 LLaVA-Video-7B 上,EventHallusion 的准确率达到 72.60%。