论文
S2H-DPO:视觉语言模型的硬度感知偏好优化
S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models
摘要
视觉语言模型 (VLM) 在单图像理解方面取得了显着进展,但跨多个图像的有效推理仍然具有挑战性。我们发现现有多图像对齐方法中存在一个关键的能力差距:当前的方法主要侧重于使用预先指定的图像索引进行局部推理(“查看图像 3 和...”),绕过了全局视觉搜索和自主跨图像比较的基本技能。为了解决这一限制,我们引入了一种从简单到困难(S2H)的学习框架,该框架跨三个层次推理级别系统地构建多图像偏好数据,需要不断提高的能力水平:(1)单图像局部推理,(2)多图像局部比较,以及(3)全局视觉搜索。与依赖于模型特定属性(例如幻觉或注意力启发法)来生成偏好对的先前工作不同,我们的方法利用提示驱动的复杂性来创建适用于不同模型的选择/拒绝对。通过对 LLaVA 和 Qwen-VL 模型的广泛评估,我们表明,我们多样化的多图像推理数据显着增强了多图像推理性能,在跨基准测试中比基线方法产生了显着改进。重要的是,我们的方法保持了强大的单图像推理性能,同时增强了多图像理解能力,从而推进了整体视觉偏好对齐的最先进技术。