论文
与自己的声音对齐:面向LVLM幻觉缓解的自我纠正偏好学习
Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs
摘要
大型视觉语言模型(LVLM)经常受到幻觉困扰。现有基于偏好学习的方法大多依赖专有模型来构建偏好数据集。我们发现这种依赖引入了专有模型与目标模型之间的分布失配,从而阻碍高效对齐。为解决这一问题,我们提出AVES-DPO(Alignment via VErified Self-correction DPO),一个利用模型内在知识衍生的同分布数据来对齐LVLM的框架。我们的方法采用基于共识的验证机制来诊断多种幻觉,并引导模型自我纠正,从而生成与其内部分布严格兼容的偏好对。大量实验表明,AVES-DPO在幻觉缓解上超越现有基线,且仅需5.2k样本。
