论文
PEA-DPO:MLLM 对齐的感知增强对齐直接偏好优化
PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment
摘要
直接偏好优化 (DPO) 已成为使 大语言模型 (LLM) 与人类偏好保持一致的有效方法。然而,它对多模式环境的适应仍有待探索。通过表征分析,我们确定了多模态偏好优化的一个关键限制,我们将其称为视觉不敏感:模型通常无法区分图像和删除了关键视觉上下文的图像。我们的理论分析进一步揭示了该问题的两种表现形式,即图像间不敏感和图像内不敏感。为了应对这些挑战,我们提出了感知增强对齐 DPO (PEA-DPO),这是一种多模态 LLM 对齐框架,它明确利用视觉偏好信号来克服视觉不敏感。我们进一步提供了理论分析,证明 PEA-DPO 可减轻这两种故障模式。实证结果表明,PEA-DPO 增强了对视觉上下文的敏感性,同时保留了基础模型的语言建模能力。使用不同规模的 MLLM 对三个幻觉基准进行的评估表明,PEA-DPO 有效缓解视觉不敏感,实现更强的多模态对齐,并大幅减少幻觉。