论文

MACD:经由反事实数据的模型感知对比解码

MACD: Model-Aware Contrastive Decoding via Counterfactual Data

模型推理解码与生成控制

摘要

视频语言模型(Video-LLM)很容易产生幻觉,当视觉证据薄弱、模棱两可或有偏见时,通常会生成看似合理但毫无根据的内容。现有的解码方法,例如对比解码(CD),依赖于随机扰动来构建对比数据以减轻幻觉模式。然而,这种方法很难控制引起幻觉的视觉线索或与模型的弱点很好地结合起来。我们提出了基于模型感知的反事实数据对比解码(MACD),这是一种将模型引导的反事实构造与解码相结合的新推理策略。我们的方法使用Video-LLM自己的反馈来识别对幻觉最有影响的对象区域,在对象级别生成有针对性的反事实输入,而不是任意帧或时间修改。然后将这些模型感知的反事实数据集成到 CD 中,以在解码过程中强制执行基于证据的标记选择。 EventHallusion、MVBench、Perception-test 和 Video-MME 上的实验表明,MACD 持续减少幻觉,同时在不同的 Video-LLM(包括 Qwen 和 InternVL 系列)中保持或提高任务准确性。该方法在涉及小型、遮挡或同时出现的对象的挑战性场景中特别有效。我们的代码和数据将公开发布。

MACD:经由反事实数据的模型感知对比解码
图1:我们所提方法的概览。它包括:使用对象级和帧级掩码的模型感知反事实数据增强,其可通过来自 VLM 的梯度进行优化;以及对比解码策略,用于提升视频中与被掩码部分相关的重要 token 的概率。