论文
超越模型大小:通过训练微型模型探索视觉情境学习中的差距
Beyond Model Size: Probing the Gaps in Visual in-Context Learning by Training a Tiny Model
摘要
视觉情境学习(VICL)旨在在自适应视觉模型方面取得进展,根据几个例子,该模型可以在测试时适应新任务。从自然语言处理研究中上下文学习的历史来看,使用大型、参数较多的模型,当前 VICL 方法采用的一种途径是将模型和数据缩放作为关键要素。然而,尚不清楚这些成分是否是视觉模型中情境学习形成的关键。为了对如此大的模型进行压力测试,我们用一个极端的反例来挑战它们:我们训练一个微小的视觉上下文模型,仅使用 100万个参数和少量 70,000张图像。我们将这种严重容量限制的微型模型与 7,000倍的较大 VICL 模型在不同自适应设置下的结果进行比较,(1) 在具有较小分布变化的图像数据上,(2) 在未见过的任务编码上,(3) 在一个全新的任务上,即设置 VICL 设想。由于小型模型和大型模型之间的训练资源存在鸿沟,我们的实验展示了如何测量自适应能力、任务编码方式、预训练 中使用了哪些任务以及指标选择等方面的不足。当前 VICL 基准测试中的这些差距强调了在适应能力评估方面进行创新的必要性。