论文

为什么多模态情境学习落后?揭示内部机制和瓶颈

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks

模型评测模型行为与机制分析

摘要

上下文学习 (ICL) 使模型能够通过推理时间演示来适应新任务。尽管在 大语言模型 中取得了成功,但 ICL 向多模式设置的扩展对其内部机制以及它与纯文本 ICL 的区别仍然知之甚少。在这项工作中,我们对多模态 大语言模型 中的 ICL 进行了系统分析。使用跨模态的相同任务公式,我们表明多模态 ICL 在零样本设置中的性能与纯文本 ICL 相当,但在少样本演示下性能显着下降。为了理解这一差距,我们将多模态 ICL 分解为任务映射构建和任务映射传输,并分析模型如何建立跨模态任务映射,并将其传输到跨层的查询样本。我们的分析表明,当前模型缺乏视觉和文本表示之间的推理级别一致性,并且无法可靠地将学习到的任务映射转移到查询。在这些发现的指导下,我们进一步提出了一种简单的推理阶段增强方法,可以增强任务映射转移。我们的研究结果为多模式 ICL 的机制和局限性提供了新的见解,并为更有效的多模式适应提出了方向。我们的代码可在 \href{https://github.com/deeplearning-wisc/Multimocal-ICL-Analysis-Framework-MGI}{here} 获取。