论文

P$^2$-DPO:通过校准直接偏好优化从感知处理入手缓解幻觉

P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization

模型训练偏好优化

摘要

幻觉最近在大视觉语言模型(LVLM)中引起了广泛的研究关注。直接偏好优化(DPO)旨在直接从人类提供的修正偏好中学习,从而解决幻觉问题。尽管取得了成功,但该范例尚未专门针对关注区域的感知瓶颈或解决针对图像退化的视觉鲁棒性不足的问题。此外,现有的偏好对通常与视觉无关,其固有的 离策略 性质限制了它们指导模型学习的有效性。为了应对这些挑战,我们提出了感知处理直接偏好优化(P$^2$-DPO),这是一种新颖的训练范例,其中模型生成并从自己的偏好对中学习,从而直接解决已识别的视觉瓶颈,同时从本质上避免了视觉不可知和 离策略 数据的问题。它介绍了:(1)针对聚焦和增强感知和视觉鲁棒性的 同策略 偏好对构建方法,以及(2)精心设计的校准损失,以精确地将视觉信号与文本的因果生成对齐。实验结果表明,在训练数据量和成本相当的情况下,P$^2$-DPO 的性能优于依赖于昂贵的人类基准反馈的强基线。此外,对注意力区域保真度(ARF)和图像退化场景的评估验证了 P$^2$-DPO 在解决关注区域的感知瓶颈和提高针对退化输入的视觉鲁棒性方面的有效性。