论文
保持警惕:通过 MLLM 中的反事实视觉对齐来缓解视觉懒惰
Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs
摘要
多模态 大语言模型 (MLLM) 通过视觉感知扩展了 大语言模型 (LLM),从而能够对图像和文本进行联合推理。尽管继承了 LLM 强大的推理能力,但他们仍然容易产生与其视觉输入相矛盾的幻觉。机制研究表明,这种弱点源于视觉惰性:MLLM 在内部编码正确的视觉证据,但在响应过程中过度依赖强大的语言先验。现有的对齐方法,例如直接偏好优化,主要基于文本优化结果级别的奖励。这引入了对语言捷径的优化偏差,导致响应常常与视觉证据相矛盾。为了解决这个问题,我们提出了 Visual Information Gain In aLignment (VIGIL),这是一种强化学习 (RL) 后训练 框架,可将焦点从数字奖励拟合转移到因果视觉证据依赖。 VIGIL 引入了几何约束,该几何约束显式地最大化视觉输入和生成的响应之间的互信息。我们通过惩罚“盲目信心”实例来实现这一目标,在这种情况下,即使文本视觉注意力被掩盖以创建反事实的盲目状态,模型仍然不正确地确定。大量实验表明,VIGIL 在幻觉和推理基准测试中始终优于最新的对齐方法,且不影响纯文本功能。我们的方法仅使用 25% 的偏好数据即可与最先进方法的全数据性能相匹配,甚至在没有明确边界框监督的情况下展示了新兴的空间基础能力。