论文

用于数据高效持续学习的相似性感知专家组合

Similarity-Aware Mixture-of-Experts for Data-Efficient Continual Learning

模型训练持续学习

摘要

由于结构化或非结构化的现实世界动态,机器学习模型在部署后通常需要适应新数据。持续学习(CL)框架支持连续模型适应,但大多数现有方法要么假设每个任务包含足够多的数据样本,要么假设学习任务不重叠。在本文中,我们解决了更一般的设置,其中每个任务可能具有有限的数据集,并且任务可能在没有先验知识的情况下以任意方式重叠。由于两个原因,这种一般设置更具挑战性。一方面,数据稀缺需要通用知识的有效情境化和跨任务的高效知识转移。另一方面,非结构化任务重叠很容易导致负面的知识转移。为了解决上述挑战,我们在预先训练的模型上提出了一种自适应专家混合(MoE)框架,该框架逐步建立任务之间的相似性意识。我们的设计包含两个创新的算法组件:增量全局池和实例提示屏蔽。前者通过随着时间的推移逐渐引入提示来减轻提示关联噪音。后者将传入的任务样本分解为与当前提示一致的任务样本(分布内)和需要新提示的任务样本(分布外)。总之,我们的设计战略性地利用了潜在的任务重叠,同时积极防止在每个任务数据稀缺的情况下产生负面的相互干扰。不同数据量和任务间相似性的实验表明,我们的方法提高了样本效率并且具有广泛的适用性。