论文

通过视觉语言设置的迭代自过滤进行数据选择

Data Selection Through Iterative Self-Filtering for Vision-Language Settings

模型训练合成数据

摘要

大量干净数据的可用性对于训练神经网络至关重要。然而,在大规模情况下,手动监督是不切实际的,导致数据集规模很大,而且噪音很大。迄今为止,试图减轻生成高性能视觉语言模型的障碍的尝试涉及启发式方法、精心策划的参考数据集和使用预先训练的模型。在这里,我们提出了一种新颖的引导方法,其中 CLIP 模型在不断发展的自选数据集上进行训练。这个不断发展的数据集构成了过滤后的、高概率的干净样本以及来自整个分布的不同样本的平衡。我们提出的自过滤方法在训练模型和选择随后改进的数据混合物之间进行迭代。对所提出的方法过滤的视觉语言数据集进行训练可以提高下游性能,而无需额外的数据或预先训练的模型。