论文
DA-DPO:用于减少多模态大语言模型幻觉的低成本难度感知偏好优化
DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations
摘要
直接偏好优化(DPO)在缓解多模态大语言模型(MLLM)幻觉方面展现出强大潜力。然而,现有多模态DPO方法常因偏好数据中的难度失衡而过拟合。我们的分析表明,MLLM倾向于过度强调容易区分的偏好对,这阻碍了细粒度的幻觉抑制并降低整体性能。为解决这一问题,我们提出难度感知直接偏好优化(DA-DPO),一个旨在平衡学习过程的低成本框架。DA-DPO由两个主要部分组成:(1)难度估计利用具有互补生成与对比目标的预训练视觉-语言模型,其输出通过分布感知投票策略整合,无需额外训练即可产生稳健的难度分数;(2)难度感知训练基于估计的难度对偏好对重新加权,降低简单样本权重同时强调更难的样本,以缓解过拟合。该框架通过优先处理有挑战性的样本实现更有效的偏好优化,无需新数据或额外的微调阶段。大量实验表明,DA-DPO持续改进多模态偏好优化,在标准基准上带来对幻觉更强的鲁棒性和更好的泛化,同时保持计算高效。项目页面见 https://artanic30.github.io/project_pages/DA-DPO/。
