论文
LLM 微调 中数据选择的长期影响
The Long-Term Effects of Data Selection in LLM Fine-Tuning
摘要
数据选择越来越多地用于降低 大语言模型 (LLM) 微调 的成本,最近的方法根据当前效用、多样性、质量或影响力对样本进行优先级排序。本文研究了一个不同的问题:当 微调 发生在多个阶段时,现在看起来最优的选择策略是否会导致模型以后的适应性较差?我们引入了 LLM 数据选择的长期视图,其中选择器不仅通过当前任务性能进行评估,还通过未来的适应速度、遗忘、能力不平衡和分布外鲁棒性进行评估。我们在统一的多阶段协议下比较了代表性的随机、基于损失、基于梯度、基于多样性、基于质量和效用多样性选择族。通过旨在实例化该协议的受控实验,我们展示了短期选择器如何表现出排名逆转:它们改善当前阶段,同时减慢后续学习并增加遗忘。我们将这种行为形式化为\emph{近视选择},对其发生的原因进行了简单的局部分析,并提出了一种诊断性的长视野感知选择(LHAS)目标,该目标通过覆盖、未来代理转移和反集中项来增强即时效用。该研究认为,数据选择应该被评估为一种塑造模型学习轨迹的训练干预,而不仅仅是作为一种本地数据效率机制。