论文

驯服视觉忽视:多模态情境学习中自适应注意力的变分信息瓶颈框架

Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning

上下文与知识上下文工程

摘要

大型视觉语言模型表现出强大的上下文学习 (ICL) 能力,但视觉上下文何时以及为何有助于多模态 ICL 仍知之甚少。实证研究显示出令人费解的二分法:模型有时有效地利用视觉演示,但常常完全忽略它们。我们提出了 VIB-ICL,这是一种信息理论框架,通过信息瓶颈原理解决了这种二分法。我们引入了跨模态信息增益(CMIG),它量化了视觉上下文提供的关于文本上下文之外的目标的额外互信息。我们得出了一个泛化界限,表明多模态 ICL 相对于纯文本 ICL 的额外风险由 CMIG 控制,证明当视觉信息非冗余时,多模态 ICL 的性能优于纯文本 ICL。我们进一步证明,视觉上下文忽略(通常被视为一种失败模式)是视觉信息冗余时的信息瓶颈最优解决方案,从而产生了封闭式注意力重新分配原则,该原则规定了如何自适应调整视觉注意力权重。我们在 VIB-ICL 算法中实例化了这一原理,该算法通过变分界限估计 CMIG 并动态重新分配注意力。五个基准测试的实验表明,准确率持续提高了 4.7%,所需演示量减少了 35%,验证了我们的理论预测。