论文

动态上下文适配器:有效地将历史注入视觉和语言模型

Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

摘要

历史上下文集成对视觉语言模型(VLM)在顺序决策任务中提出了根本性挑战。当前的 VLM 独立处理视觉输入,这对需要时间理解的下游应用程序造成了严重限制。将历史帧直接合并到 Transformer 输入中会产生二次注意力复杂度和过多的内存消耗。现有方法存在重大缺陷:计算膨胀或时间压缩造成的大量信息丢失。为了应对这些挑战,我们引入了动态上下文适配器 (DCA),这是一种用于预训练 VLM 的新颖上下文注入方法。我们的方法采用固定大小、动态压缩的内存来保留历史语义,而无需帧连接。 DCA 连接静态 VLM 和循环策略,并在预训练模型中启用内存功能,同时保持计算效率。 DCA 减少了超过 $25\%$ 的注意力失败,节省了 $13\%$ 的内存,同时提高了长期任务的性能。