论文

CL-VISTA:视频中持续学习的基准测试 大语言模型

CL-VISTA: Benchmarking Continual Learning in Video Large Language Models

模型评测基准与评测资源

摘要

视频大语言模型(Video-LLM)需要不断学习以适应非平稳的现实世界数据。然而,现有的基准测试不足以评估现代基础模型:许多基准测试仍然依赖于没有大规模 预训练 的模型,并且流行的基准测试通常将单个数据集划分为子任务,导致预训练的 Video-LLM 上的任务冗余度很高,遗忘可以忽略不计。为了解决这些限制,我们提出了 CL-VISTA,这是一个为持续视频理解 Video-LLM 量身定制的基准。通过策划 8 项涵盖感知、理解和推理的不同任务,CL-VISTA 引发了重大的分布变化,有效地暴露了灾难性遗忘。为了系统地评估 CL 方法,我们建立了一个全面的评估框架,包括跨 3 个关键维度的 6 个不同协议:性能、计算效率和内存占用。值得注意的是,性能维度包含了一般的视频理解评估,以评估 CL 方法是否真正增强了基础智能,还是仅仅导致了特定任务的过度拟合。对 10 种主​​流 CL 方法的广泛基准测试揭示了一个基本的权衡:没有一种方法能够在所有维度上实现普遍的优越性。成功减轻灾难性遗忘的方法往往会损害泛化能力或产生过高的计算和内存开销。我们希望 CL-VISTA 为推进多模式基础模型的持续学习提供重要的见解。