论文

目的:用于视觉问答持续学习的不对称信息屏蔽

AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning

模型训练持续学习

摘要

在持续视觉问答(VQA)中,现有的持续学习(CL)方法大多是为对称、单峰架构构建的。然而,现代视觉语言模型(VLM)违反了这一假设,因为它们的可训练组件本质上是不对称的。这种结构不匹配使得 VLM 在从连续数据流中学习时极易发生灾难性遗忘。具体来说,不对称性导致标准全局正则化在优化期间有利于大规模语言解码器,从而使较小但关键的视觉投影层极易受到干扰。因此,这种局部退化导致构图推理能力的严重丧失。为了解决这个问题,我们提出了非对称信息屏蔽(AIM),它通过应用基于模态特定敏感性的目标屏蔽来平衡稳定性和可塑性。在连续 VQA 设置下对 VQA v2 和 GQA 进行的实验表明,AIM 在平均性能 (AP) 和平均遗忘 (AF) 方面均实现了最先进的性能,同时更好地保留了对新颖技能概念组合的泛化。