论文

LVLM 中的语言偏差:从深入分析到简单有效的缓解措施

Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation

模型训练监督微调与指令调优

摘要

大视觉语言模型 (LVLM) 通过视觉理解扩展了 大语言模型,但仍然容易产生幻觉,即输出流畅但与图像不一致。最近的研究将此问题与语言偏见联系起来,即 LVLM 过度依赖文本而忽视视觉输入的倾向。然而,大多数分析仍然是经验性的,没有揭示其根本原因。在本文中,我们对语言偏差进行了系统研究,并确定了其在训练期间模态失调的根源。我们的分析表明,视觉指令调优(VIT)和直接偏好优化(DPO)通常优先考虑文本改进,这可能导致 LVLM 过度倾向于语言建模而不是平衡的多模态理解。为了解决这个问题,我们提出了两种简单而有效的方法:语言偏差正则化(LBR),通过指令调整期间的正则化来减轻语言偏差;以及语言偏差惩罚(LBP),它在 DPO 训练过程中惩罚语言偏差。跨不同模型和基准的广泛实验证明了我们方法的有效性。 LBR 持续提高了十多个通用基准的性能,而 LBP 显着减少了幻觉并提高了可信度。总之,这些方法不仅可以减轻语言偏差,还可以促进 LVLM 的整体对齐,所有这些都无需引入任何额外的数据或辅助模型。我们的代码可在 https://github.com/lab-klc/LVLM-Language-Bias 上公开获取。