论文
用于减轻 VLM 中幻觉的视觉驱动偏好合成
Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs
摘要
视觉语言模型(VLM)在视觉理解方面表现出了强大的性能,但它们仍然会产生幻觉,生成不以图像为基础的内容。偏好对齐是一种很有前景的改善视觉 忠实性 的方法,但其成功在很大程度上取决于偏好对的构建方式。现有方法存在两个主要局限性; (a) 基于干预的方法通常会导致政策分布的显着偏差,(b) 基于抽样的方法在构建过程中经常未充分利用视觉信息。在本文中,我们提出了 ViPSy(视觉驱动的偏好综合),这是一个用于构建既符合政策又基于视觉的偏好数据的框架。我们的框架由两个阶段组成;在第一阶段,ViPSy 从语义对齐的图像变体中重复出现的对象级内容中获取视觉提示,因此偏好构建可以依赖于视觉信息而不是语言先验。在第二阶段,ViPSy 根据这一提示来调整策略自身的采样轨迹,允许候选人以具有视觉依据的内容为指导,同时密切关注政策的响应分布。由此产生的候选者仍然接近政策的响应分布,同时更好地利用图像中的视觉信息。实验表明,由此产生的 VLM 与 ViPSy 构建的偏好对一致,在缓解幻觉方面达到了新的最先进水平。与之前最先进的方法相比,它在 AMBER 和 Object HalBench 上的幻觉率分别降低了 35.7% 和 24.5%。由此产生的模型进一步改进了通用视觉基础基准,例如 MMStar、MMVP 和 CV-Bench,同时在语义分割和 ImageNet 线性探测方面也取得了进展,强调了我们的框架在增强模型视觉能力方面的有效性。