论文

当文本劫持视觉时:视觉语言模型中的基准测试和减轻文本叠加引起的幻觉

When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 的最新进展极大地增强了它们跨时间、动作、对象和空间理解的多模态视频理解基准的能力。然而,我们发现了一个关键但被忽视的问题:当嵌入的屏幕文本与视觉场景相矛盾时,现有的 VLM 会系统性地产生幻觉,优先考虑覆盖文本语义而不是实际的视觉内容。我们将这种现象定义为文本叠加引起的幻觉(TOIH)。在这项工作中,我们提出了 VisualTextTrap,这是第一个综合基准测试,包括具有专门设计的评估指标的大规模人类验证样本。特别是,我们使用 VLM 辅助文本生成和严格的手动验证的可扩展混合管道,从广泛使用的公共数据集构建 VisualTextTrap。该基准测试包含 6,057 个样本,这些样本在四个维度内的 88 个细粒度属性上进行了注释,幻觉强度在五个级别(L1--L5)上进行了量化,反映了覆盖文本和视觉现实之间的语义矛盾。此外,我们提出了视觉文本幻觉缓解专家混合(VTHM-MoE),这是一种采用双编码器架构的新颖的视觉文本解开框架。具体而言,首先对涵盖时间、动作、对象和空间推理的四个维度专业专家模块进行预训练,以识别和利用文本语义与实际视频内容之间的跨模式差异。我们开发了一种自适应词元路由策略,以实现动态专家分配,赋予对 TOIH 的强大抵抗力,同时保留未受污染视频的性能。在我们的 VisualTextTrap 基准测试上进行的大量实验验证了 VTHM-MoE 的有效性,其在各种视频问答任务中的表现优于最先进的同行。