论文

OnceSelect:可重复使用的数据选择,实现高效的多模式指令调整

OnceSelect: Reusable Data Selection for Efficient Multimodal Instruction Tuning

模型训练合成数据

摘要

多模态指令调优被广泛用于适应多模态 大语言模型 (MLLM),但它所依赖的大规模图像文本数据集通常是高度冗余的。现有的数据选择方法通常与特定数据集、目标模型或训练状态相关联,在转移到新设置时需要重新训练或重新计算。我们询问选择信号是否可以学习一次并在数据集和模型中重复使用。我们提出了 OnceSelect,这是一种可重复使用的数据选择器,经过一次训练并直接应用于未见过的数据集。 OnceSelect 在冻结的联合多模态空间中对图像指令对进行编码,将它们聚类成捕获粗略语义结构的伪标签,并使用固定的验证宏观准确性标准训练轻量级选择器。学习分区下的低置信度样本被视为信息丰富的候选者。由于选择器独立于下游 MLLM,因此它可以跨数据集传输,而无需重新训练或依赖于模型的评分,而选定的子集可以跨模型架构重用。 OnceSelect 仅使用 15% 的 LLaVA-625K,在九个评估指标中保留了 99.2% 的全数据聚合性能。无需重新训练,它在未见过的 Vision-Flan-186K 和 LRV-Sub-180K 上实现了 103.4% 和 102.5% 的相对性能。相同的 93.7K LLaVA 子集在 Qwen3-VL 和 InternVL3 模型中进一步实现了 99.9-106.7% 的相对性能,而无需模型特定的评分或重新选择。这些结果证明了跨数据集和模型架构的高效且可重用的多模式数据选择。代码可在 https://github.com/DMK041218/OnceSelect 获取