论文

当提示超越视觉时:LVLM 中提示引起的幻觉

When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs

模型训练偏好优化

摘要

尽管大型视觉语言模型(LVLM)的能力取得了令人瞩目的进步,但这些系统仍然容易产生幻觉,即输出不以视觉输入为基础。先前的研究将 LVLM 中的幻觉归因于视觉骨干的限制或语言成分的主导等因素,但这些因素的相对重要性仍不清楚。为了解决这种模糊性,我们提出了 HalluScope,这是一个更好地了解不同因素诱发幻觉的程度的基准。我们的分析表明,幻觉很大程度上源于对文本先验和背景知识的过度依赖,尤其是通过文本指令引入的信息。为了减轻由文本指令先验引起的幻觉,我们提出了 HalluVL-DPO,这是一种用于 微调 现成 LVLM 的框架,可实现更加基于视觉的响应。 HalluVL-DPO 使用我们构建的精选训练数据集进行偏好优化,引导模型更喜欢基于幻觉的响应。我们证明,我们的优化模型有效地减轻了目标幻觉失败模式,同时保留或提高了其他幻觉基准和视觉能力评估的性能。为了支持可重复性和进一步研究,我们将在 https://pegah-kh.github.io/projects/prompts-override-vision/ 公开发布我们的评估基准、偏好训练数据集和代码。