论文
Quo Vadis,视觉情境学习?跨领域和任务的统一基准
Quo Vadis, Visual In-Context Learning? A Unified Benchmark Across Domains and Tasks
摘要
视觉上下文学习已被提议作为动态模型的途径,该模型可以根据提供的上下文生成预测,从而可以在测试时适应新的视觉任务。然而,对这些模型的适应能力的评估仅限于狭窄的设置,这些设置主要镜像 预训练 中的任务或图像域,不需要真正的适应。我们通过构建广泛的视觉上下文基准(VIBE)来解决这一差距,重点关注不同的成像领域和广泛的任务。通过这一点,我们能够更清楚地了解视觉上下文模型在面对新的图像和任务分布时的自适应能力。我们在 14个数据集和 12类任务上对六个模型进行了压力测试(我们总共探索了 106种数据集与任务组合),并在统一的、可重复的评估协议下,在一次性设置中对它们进行了比较。我们的评估揭示了关于视觉情境学习状态的关键见解,包括局限性、系统故障模式和有希望的方向。为了促进更广泛的评估,我们将公开发布 VIBE 工具包。