论文
不断发展的领域的视频-MLLM 适应
Continual Video-MLLM Adaptation over Evolving Domains
摘要
视频多模态 大语言模型 在视频理解方面表现出了强大的能力,但它们对连续发展的领域的适应仍有待探索。在现实世界的部署中,视频数据通常从异构域连续到达,要求模型获取新的特定于域的知识,而不覆盖以前学习的功能。现有的持续学习方法通常依赖于共享的适应空间,这可能会导致严重的跨域干扰和灾难性遗忘。我们提出了分布式感知专家路由,这是一种参数高效的框架,用于在不断发展的领域中进行持续的视频 MLLM 适应。 DAER 维护领域隔离的轻量级专家,同时保持预训练的 Video-MLLM 主干网冻结,从而将特定领域的适应与预训练模型的通用多模态知识解耦。为了实现细粒度的专业化,我们引入了一种域内分布感知路由机制,该机制使用 MMD 将每个输入与专家级原型存储库相匹配。为了解决推理时任务身份缺失的问题,我们进一步提出了一种域间路由机制,该机制在判别性子空间中执行原型匹配,以实现鲁棒的域识别。此外,我们引入自适应域合并来提高参数可扩展性,并采用两阶段优化策略来稳定持续学习期间的专家专业化。我们通过策划一个领域增量基准来评估 DAER,该基准由涵盖不同视觉环境和推理需求的 10 个 VidQA 数据集构建。在两个强大的 Video-MLLM 主干上进行的实验表明,DAER 始终优于先前的方法。