论文

SEED:通过加权独立集进行目标数据选择

SEED: Targeted Data Selection by Weighted Independent Set

模型训练合成数据

摘要

数据选择旨在从大规模训练语料库中识别紧凑但信息丰富的子集,平衡样本质量与集合多样性。我们将这个问题表述为相似图上的加权独立集(WIS),其中节点表示按影响力加权的数据样本,边连接语义冗余对。这种公式自然会产生同时高质量和多样化的子集。然而,在实践中出现了两个挑战:朴素节点权重无法区分信息信号和梯度噪声,并且异构域分布下的边缘构造会产生结构不平衡的图,使选择偏向稀疏区域。为了解决这些问题,我们从统一图的角度引入了两个原则性的改进:(1)\textit{节点值校准},将影响估计限制在任务相关信号中的双边显着子空间到地面节点重要性,而不是表面级统计; (2) \textit{局部尺度归一化},使边缘阈值适应局部邻域密度,减轻跨域分布变化引起的图不平衡。这些组件共同产生了一个强大且可扩展的数据选择管道,称为 SEED。我们进一步构建了 \texttt{Honeybee-Remake-SEED-200K},这是一个由 SEED 管理的紧凑多模态数据集。大量实验表明,SEED 在不同模型系列的指令调优、视觉指令调优和语义分割方面始终优于最先进的方法。