论文
视觉语言模型中的上下文崩溃以及如何缓解它?
In-Context Collapse in Vision-Language Models and How to Mitigate it?
摘要
多镜头上下文学习 (ICL) 允许视觉语言模型 (VLM) 在无需更新权重的情况下适应图像标签演示,并且被广泛认为会随着提供更多演示而得到改进。我们展示了相反的情况:随着演示的积累,VLM 的子集会经历 \emph{上下文崩溃},这是跨越合成分类、自然图像分类和 VQA 基准的急剧的、有时是灾难性的精度下降,在某些模型中,在输出保持良好格式的情况下,精度下降到低于概率。通过开放的 VLM 面板($0.5$B--$11$B)和前沿模型(Claude Sonnet 4.5),对崩溃进行了分级。事实证明,两种能力是不可关联的:对累积演示的鲁棒性和在上下文中学习新规则的能力,它们的组合产生了三种可复制的机制。参数匹配的损伤和救援将崩溃因果地定位到视觉语言集成路径:连接器和早期/中期层上的适配器恢复了真正的学习(16个示例时重映射精度为 0.39→0.91),而后期读出上的同等容量适配器则不能。我们提出 \textsc{CircA},其核心是一次性集成疫苗:在一项综合任务上训练一次,它将抗崩溃性转移到看不见的任务系列(CIFAR/Fashion 上的机会$\rightarrow$$0.71$/$0.60$)。最适合上下文集成的层并不是最适合基于权重的合并的层,后期读出以更少的参数实现了更高的准确性和更少的遗忘。这种崩溃是视觉-语言界面的整合失败,可以通过轻量级、可转移的干预来纠正。