论文

HyLoVQA:动态超网络生成的低秩适应,用于连续视觉问答

HyLoVQA: Dynamic Hypernetwork-Generated Low-Rank Adaptation for Continual Visual Question Answering

模型训练持续学习

摘要

持续视觉问答(VQA)需要从非平稳的视觉输入和问题流中学习,同时保留过去的知识。大多数现有方法通过更新很大程度上共享的参数集来适应。这往往会导致跨层级的任务干扰,阻碍对当前任务和对象的准确适应。为了解决这个限制,我们提出了 HyLoVQA。它维护着一个具有抗漂移能力的锚点记忆库。该库存储视觉对象和文本任务的内容,并使用当前输入特征进行更新。以检索到的锚点为条件,超网络生成轻量级低秩适应(LoRA)适配器。这确保了参数效率,使模型能够动态适应每个任务和对象。此外,我们还制定了对齐损失,将特征空间中的语义差异与参数空间中的功能变化对齐,从而限制 LoRA 适配器继续专注于当前任务和对象。在标准和组合设置下对 VQA v2 和 NExT-QA 进行的大量实验证明了 HyLoVQA 相对于先前最先进方法的优越性。