论文

ECA:开放式图像到文本生成的高效持续对齐

ECA: Efficient Continual Alignment for Open-Ended Image-to-Text Generation

模型训练持续学习

摘要

用于开放式图像到文本生成 (OpenITG) 的增量学习 (IL) 使模型能够持续为新图像生成准确的、上下文相关的文本,同时保留以前获得的知识。与之前的研究不同,本文讨论了一个更实际的场景,其中视觉数据的主要类别随着环境的演变而变化。在这种情况下,我们引入了连续对齐的新概念,它逐步调整预先训练的 VLM 中的对齐模块,以保留高质量的跨模式表示。基于这个想法,我们提出了高效连续对齐(ECA),这是一种针对 OpenITG 的新颖的无示例 IL 方法。关键的挑战是使模型能够获取新的、特定于任务的特征,同时最大限度地减少对已建立的对齐的干扰,而无需访问以前任务的原始数据。为了解决这个问题,ECA 采用了三种核心机制:适应特定于任务的查询标记的查询混合 (MoQ) 模块、基于费舍尔信息矩阵 (FIM) 的度量动态扩展模型结构的费舍尔动态扩展 (FeDEx),以及带有字典重放 (DR) 的嵌入字典以保留过去的知识。为了评估 ECA 的性能,我们构建了四个新的 IL OpenITG 基准,以更好地反映现实场景。实验结果表明,与基线方法相比,ECA 显着减轻了灾难性遗忘并提高了 IL 性能。代码和基准可在 https://github.com/Snowball0823/ECA 上获取。