论文

多模式的不确定性感知探索性直接偏好优化 大语言模型

Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models

模型训练偏好优化

摘要

直接偏好优化 (DPO) 已被证明是通过学习偏好对来减轻多模式 大语言模型 (MLLM) 中幻觉的有效解决方案。其关键挑战之一在于如何将序列级偏好转化为对视觉保真度的细粒度监督。为了保护容易产生幻觉的视觉相关标记,现有方法通常根据模型自我评估的视觉敏感度信号来分配训练重点。然而,这种由仍在训练中的模型估计的敏感性会引入自我参照偏差:强化已经熟知的视觉线索,同时忽略难以感知但关键的细节,从而限制了更深层次的对齐。在这项工作中,我们提出了一种针对 MLLM 的不确定性感知探索性直接偏好优化(UE-DPO)方法,该方法使模型能够在 词元级 认知不确定性的指导下发现其认知缺陷并积极探索自我纠正。具体来说,我们首先量化模型未能在给定图像中实现标记预测的不确定性。然后,基于不确定性感知的探索强度,我们鼓励对首选样本中视觉缺陷标记施加更多学习压力,并减轻对非首选样本中有益知识的过度惩罚。此外,我们为我们的方法提供了理论依据,并且大量的实验证明了其有效性和鲁棒性。