论文

过滤然后加权:LLM 微调 的在线数据选择和重新加权

Filter-then-Weight: Online Data Selection and Reweighting for LLM Fine-Tuning

模型训练合成数据

摘要

基于梯度的数据选择为估计 大语言模型 (LLM) 微调 中的样本效用提供了原则框架,但现有方法大多是为离线设置而设计的。因此,它们不太适合在线 微调,其中数据按顺序到达,样本效用是步骤相关的,并且有效的更新几何由自适应优化器塑造。我们在 LLM 微调 中提出了一种优化器感知框架,用于基于梯度的在线数据选择和重新加权。我们的关键思想是,不要将在线选择视为静态样本排名,而是将其视为在当前优化器状态下塑造下一个面向目标的更新。我们将其表述为优化器感知的更新匹配问题,建立其与二阶目标效用的连接,并说明为什么子集级构造必须考虑所选样本之间的交互和冗余。基于这个观点,我们开发了一种两阶段过滤然后加权算法,首先过滤几何上有用的候选者,然后优化它们的系数。为了使该框架适用于 LLM,我们引入了因式外积梯度表示和针对长上下文数据的优化矩阵计算。实验表明,在相同的数据预算下,我们的方法相对于现有的在线数据选择基线持续提高了收敛性和下游性能。