论文
MultiToP:学习修补视觉标记以减轻视频大型多模态模型中的幻觉
MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models
摘要
视频大型多模态模型在视频理解方面取得了显着的进步,但它们仍然容易产生幻觉,即输入视频不能忠实地支持生成的响应。在本文中,我们提出了 MultiToP,一种多模态上下文感知的视觉标记修补框架,它通过在语言生成之前精炼不可靠的视觉标记来减轻幻觉。 MultiToP 引入了一个轻量级的视觉词元修补程序来预测 词元级 替换分布,并有选择地用动态全局补丁词元替换不可靠的视觉词元。为了有效地训练补丁程序,我们进一步提出了信息引导的排名校准,它使用从骨干网导出的答案条件帧级信息线索来指导词元替换。结合 真值 答案监督和稀疏正则化,MultiToP 可以在不修改原始模型的情况下实现局部视觉证据细化。大量实验表明,MultiToP 可以有效减少 Vript-HAL 上的幻觉,而推理开销可以忽略不计,与普通模型相比,Qwen3-VL-4B-Instruct 的 F1 分数提高了 50.60%。同时,MultiToP 保留了一般视频理解能力,使 Video-LLaVA-7B 的 ActivityNet-QA 相对准确度提高了 18.58%。