论文
上下文图像值得 10 维吗?
Are In-Context Images Worth 10 Dimensions?
摘要
在理解大语言模型的情境学习能力方面已经做了很多工作,特别是在归纳电路方面。对于几次分类任务,归纳电路利用上下文中每个标记示例的线性表示来对未标记的查询进行分类。然而,很少有作品首先关注这些线性表示是如何构建的。与文本相比,利用视觉模态的表现力,我们在大视觉语言模型(LVLM)中发现了共享判别几何(SDG)。它是一个低维空间,在所有图像分类任务之间共享,其中上下文图像被压缩为线性可分离的表示,随后用于执行分类。我们观察到,这是模型在早期层中对视觉表示进行降维的结果。为了解释这一现象:(1)我们分析表明,线性自注意力可以通过将上下文数据投影到其主成分上来执行降维,每一层都为实现这一目标实施一个梯度下降步骤。 (2) 我们提供的证据表明,训练有素的 LVLM 通过类似的机制降低了早期层中视觉表示的维度。