论文
从细粒度的视觉差异中学习:通过上下文视觉对比优化减轻多模态幻觉
Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
摘要
多模态幻觉仍然是视觉语言模型(VLM)的一个持续挑战。由于缺乏明确的视觉监督,标准文本直接偏好优化 (DPO) 通常无法缓解这一问题。虽然现有的工作通过将原始图像与负片图像进行对比来引入视觉偏好 DPO,但它们由于配分函数不匹配而导致理论上目标不一致,并且依赖于可以实现快捷学习的粗粒度负片。在这项工作中,我们提出了上下文视觉对比优化(IC-VCO)。通过将对比图像放置在共享的多图像环境中,IC-VCO 确保了数学上严格的目标。我们进一步介绍了 Visual Contrast 蒸馏 (VCDist),这是一种辅助可靠性门控正则化器,可促进多图像对比训练和单图像推理之间的一致性。最后,我们提出了一种对比样本编辑策略,通过精确的语义扰动生成硬底片。五个基准测试的实验证明了 IC-VCO 的最佳整体性能和我们的样本编辑策略的有效性。代码和数据可在 https://github.com/OPPO-Mente-Lab/IC-VCO 获取。