论文
动态集群数据采样,实现高效且长尾感知的视觉语言 预训练
Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training
摘要
通过对训练数据进行采样可以降低训练视觉语言模型 (VLM) 的计算成本。之前关于高效VLM 预训练的工作已经指出了语义数据平衡的重要性,调整数据中主题的分布以提高VLM的准确性。然而,现有的高效 预训练 方法可能会不成比例地从训练语料库中删除稀有概念。因此,长尾概念在训练数据中仍然没有得到充分的体现,并且在训练过程中没有被有效地捕获。在这项工作中,我们引入了一种基于动态集群的采样方法(DynamiCS),该方法可以对大数据集群进行下采样,并对小数据集群进行上采样。我们首先展示了集群扩展方法的优势,该方法保持了数据中语义集群的相对顺序并强调了长尾。这种方法与当前的工作形成鲜明对比,当前的工作仅关注于扁平化数据的语义分布。然后,我们展示了动态采样的重要性,动态采样在每个时期应用采样来提高跨时期数据多样性并使上采样实用。我们的实验表明,DynamiCS 降低了 VLM 训练的计算成本,并为长尾概念提供了性能优势。代码可在 https://github.com/MingliangLiang3/DynamiCS 获取。