论文
为什么多模态情境学习落后?揭示内部机制和瓶颈
Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks
摘要
上下文学习 (ICL) 使模型能够通过推理时间演示来适应新任务。尽管在 大语言模型 中取得了成功,但 ICL 向多模式设置的扩展对其内部机制以及它与纯文本 ICL 的区别仍然知之甚少。在这项工作中,我们对多模态 大语言模型 中的 ICL 进行了系统分析。使用跨模态的相同任务公式,我们表明多模态 ICL 在零样本设置中的性能与纯文本 ICL 相当,但在少样本演示下性能显着下降。为了理解这一差距,我们将多模态 ICL 分解为任务映射构建和任务映射传输,并分析模型如何建立跨模态任务映射,并将其传输到跨层的查询样本。我们的分析表明,当前模型缺乏视觉和文本表示之间的推理级别一致性,并且无法可靠地将学习到的任务映射转移到查询。在这些发现的指导下,我们进一步提出了一种简单的推理阶段增强方法,可以增强任务映射转移。我们的研究结果为多模式 ICL 的机制和局限性提供了新的见解,并为更有效的多模式适应提出了方向。我们的代码可在 \href{https://github.com/deeplearning-wisc/Multimocal-ICL-Analysis-Framework-MGI}{here} 获取。