论文

De CoupleMix:可扩展 VLM 数据配方的解耦比率搜索和凸分配

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

模型训练合成数据

摘要

虽然视觉语言模型(VLM)的数据管理日益活跃,但构建预训练混合物的公共实践在很大程度上仍然是启发式的:从业者堆叠通过质量过滤器的数据集,凭直觉设置跨域比率,缺乏接受新数据的原则性、可归因的标准,而前沿配方仍未公开。我们将数据构建表述为一个系统的混合优化问题,并通过将混合解耦为两个正交子问题:跨能力的类间比率和类别内的类内比率,将其转变为可重现的工程学科。对于类间分配,我们使用单变量迭代搜索;对于类内组成,我们应用多维、数据集级评估评分质量和难度,并将选择制定为具有多样性目标的约束凸优化。 De CoupleMix 框架提供了两项关键功能:指导接下来收集哪些数据,以及将数据集验证呈现为受控的、可归因的实验。实验表明我们的方法始终超越启发式基线。此外,在小规模代理上发现的最佳比率可以无缝转移到更大的规模,而无需重新调整。使用 80B 个额外的多模式持续预训练词元,我们的 VLM 与使用更大的多模式预算训练的强大开源模型具有竞争力。