论文

DPO 中的上下文失明:通过上下文校准偏好优化减轻 MLLM 中的物体幻觉

Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

模型训练偏好优化

摘要

多模态 大语言模型 (MLLM) 取得了快速进展,但它们仍然表现出物体幻觉,生成看似合理但不正确的描述,与视觉输入不一致。直接偏好优化(DPO)通过训练模型更喜欢非幻觉反应而不是幻觉反应来缓解这一问题,并且最近的努力进一步丰富了具有相关背景的偏好数据。然而,目前尚不清楚 DPO 是否真正利用了这种背景。为了研究这个问题,我们提出了上下文偏好增益(CPG),这是一个简单的指标,用于衡量在提供相关上下文时模型的偏好增强了多少。我们发现较高的 CPG 始终对应于较低的幻觉,但标准 DPO 及其变体仅表现出有限的 CPG,这表明它们未充分利用上下文信息,因此仍然容易产生幻觉。为了解决这个问题,我们提出了上下文校准 DPO (C$^2$-DPO),它直接最大化 CPG,同时保留原始偏好顺序。在多个基准测试中,C$^2$-DPO 在不影响一般推理的情况下大幅减少了幻觉,相对将 Qwen2-VL-Instruct-2B 的 Object HalBench 幻觉率降低了 36%。代码可在 https://github.com/mlvlab/C2-DPO 获取