论文

通过分区拟阵约束梯度匹配进行语言模型的小批量选择

Minibatch Selection for Language Models via Partition Matroid Constrained Gradient Matching

模型训练合成数据

摘要

在异构数据上训练 大语言模型 (LLM) 需要选择能够平衡收敛速度与跨域覆盖的小批量。现有方法要么在每个域内独立选择样本,要么依赖计算成本昂贵的代理模型来学习连续域权重。我们提出了 PartitionSel,一种跨域小批量选择方法,可在编码为分区拟阵约束的每个域预算下最大化验证引导的梯度匹配效用。通过单个实用程序耦合每个域的预算,PartitionSel 旨在减少跨域选择的冗余。所提出的目标是弱子模的,并且允许具有可证明的近似保证的正交匹配追踪算法。根据经验,我们在 MetaMathQA 和 Mol-Instructions 上的 Qwen2.5 和 Llama-3 的 微调 期间评估 PartitionSel 的小批量选择。 PartitionSel 在两个基准测试中都比每个域和与域无关的基线取得了强劲的进步。它还减少了每个批次内冲突的梯度对的数量,表明跨域耦合转化为更兼容的训练更新。