论文
DOSE:通过现成模型进行多模态 LLM 的数据选择
DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models
摘要
高质量和多样化的多模态数据对于改进视觉语言模型 (VLM) 至关重要,但现有数据集通常包含噪声、冗余和对齐不良的样本。为了解决这些问题,数据过滤通常用于提高多模态学习的效率和性能,但它会带来额外的计算成本,因为过滤模型通常是在它们要筛选的相同数据上进行训练的。为了降低这个成本,我们研究了 DOSE,它探索是否可以使用从未见过目标数据的现成预训练模型来为更大更强的多模态模型选择训练样本,而无需任何特定任务的训练。即使没有 微调,这些模型也可以有效评估文本质量和图文对齐,以指导数据选择。在此基础上,我们构建了联合质量对齐分布,并应用自适应加权采样来选择信息丰富的样本,同时保持长尾多样性。这种方法增强了数据多样性,使在 DOSE 过滤数据上训练的模型能够匹配或超越在标准 VQA 和数学基准的完整数据集上训练的模型。大量的实验证明了其有效性、效率和可扩展性。