论文
DICA:多模态大语言模型中的双指标引导对比对齐
DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models
摘要
人类的视觉推理通常遵循由粗到细的注意过程:从全局场景理解出发,逐渐聚焦于与问题相关的区域。然而,多模态大语言模型(MLLM)可能因注意力漂移和视觉证据利用不足而偏离这一模式,进而引发幻觉。为缓解这些问题,本研究提出双指标引导对比对齐(Dual-Indicator Guided Contrastive Alignment, DICA),在推理过程中追踪两个信息论指标:反映视觉注意力集中程度的视觉注意力熵(Visual Attention Entropy, VAE),以及衡量生成输出对视觉输入依赖程度的输出—图像相关性(Output Image Correlation, OIC)。VAE的异常升高或OIC的下降对应不同的失效模式,由此触发有针对性的对比对齐以恢复视觉定位。在多个基准上的实验结果表明,DICA持续优于现有方法并大幅减少幻觉,凸显了指标驱动干预在提升多模态推理可靠性方面的有效性。代码已公开发布于 https://github.com/BGWH123/DICA/。
