论文

STEAR:分层感知时空证据干预,用于减轻视频中的幻觉 大语言模型

STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models

模型推理解码与生成控制

摘要

视频 大语言模型 (Video-LLM) 仍然容易产生时空幻觉,经常产生视觉上不受支持的细节或不正确的时间关系。现有的缓解方法通常将幻觉视为统一解码失败,应用全局共享的校正规则。相反,我们观察到解码器层对视觉基础和后来的语言构成的贡献不同,这表明干预必须是层感知的。基于这一见解,我们提出了 STEAR,一种分层感知的时空证据干预框架。 STEAR 识别高风险解码步骤,并从视觉依据敏感的中间层中选择标记条件的视觉证据。它将这种共享证据用于两个耦合目的:恢复中间层中缺失的局部视觉依据,以及构建时间扰动的补丁级反事实,以在后期层解码期间伪造不一致的推理。因此,STEAR 在高效的单编码推理框架内减轻了空间和时间幻觉。跨代表性 Video-LLM 主干和具有挑战性的基准的实验表明,STEAR 持续减少幻觉,同时提高 忠实性、时间一致性和鲁棒性。我们的结果证实,可靠的视频解码依赖于对正确层的精确证据进行干预,而不是强制执行全局惩罚。该代码在补充材料中提供。