论文

logits-注意力发散:通过注意力引导校准减轻多图像检索中的位置偏差

Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration

模型推理解码与生成控制

摘要

多模态 大语言模型 (MLLM) 在多图像跨模态检索中表现出强大的性能,但存在严重的位置偏差,其中预测由输入顺序而不是语义相关性主导。通过实证分析,我们发现了一种称为“logits-注意力发散”的现象,其中输出 logits 存在严重偏差,而内部注意力图与相关视觉证据保持良好一致。这一观察揭示了现有 logits 级校准方法(例如 PriDe)的根本局限性。基于这一见解,我们提出了一种 无需训练,即注意力引导去偏差框架,该框架利用内在注意力信号在推理时进行实例级校正,只需要最小的校准集,计算开销可以忽略不计。基于 MS-COCO 的基准测试表明,我们的方法大大提高了排列不变性并实现了最先进的性能,与基线相比,准确度提高了 40% 以上。代码可在 https://github.com/brightXian/LAD 获取。