论文
每一批都是自己的验证集:LLM微调中在线数据选择的留一梯度匹配
Every Batch Is Its Own Validation Set: Leave-One-Out Gradient Matching for Online Data Selection in LLM Fine-Tuning
摘要
在线批次选择可针对每个候选批次中最有用的部分微调语言模型。与候选批次的梯度相匹配的选择器很有吸引力,因为它们不需要保留数据,但它们很少能击败整个批次的训练。我们展示原因。样本内梯度匹配使用每个示例作为其自身目标的一部分,因此其目标将每个示例归功于其自己的梯度噪声。这是使训练误差变得乐观的协方差惩罚,现在位于梯度 Gram 矩阵的对角线上:它将选择引向最嘈杂的示例,并使整个批次成为目标可以达到的最佳解决方案。修复无需花费任何费用。对于每个示例,其他候选者形成数据分布的独立样本,因此删除对角线会将匹配目标转变为相对于总体梯度的更新误差的无偏估计。这种留一法目标的最小化器通过梯度信噪比(SNR)对示例进行加权,并且每当每个示例的 SNR 足够异构时,一半批次产生的更新误差低于整个批次;我们给出确切的条件。我们根据这个原则构建了\method{}。它在普通后向传递期间以 Adam 预处理器的度量计算 Gram 矩阵,以 $(1-e^{-γ})$ 保证贪婪地选择加权子集,并且不使用保留的数据。在从 1.5B 到 8B 参数的四个微调任务和七个骨干网中,LOOM 在 Llama-3.1-8B 和 Qwen2.5-7B 上的全批量训练提高了 2.3 和 2.4 个点,超过每个样本内梯度匹配器 2.4 个点,超过验证引导的 GREATS 和 OPUS 1.6--2.0 个点,并选择注入标签噪声低于其基值的五分之一率。