论文

数据难度与泛化--LLM 微调 中的外推权衡

Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning

模型训练合成数据

摘要

受监督的 微调 (SFT) 期间的数据选择可以严重改变 大语言模型 (LLM) 的行为。尽管现有的工作已经研究了基于启发式(例如困惑度、难度或长度)选择数据的效果,但报告的结果往往不一致或依赖于上下文。在这项工作中,我们从实证和理论的角度系统地研究了数据难度在微调中的作用,发现不存在普遍最优的难度水平;相反,它的有效性取决于数据集的大小。我们证明,对于固定的数据预算,SFT 存在一个最佳数据难度,并且随着数据预算的增加,这个最佳难度会转向更难的数据。为了解释这种现象,我们进行了受控合成实验,揭示了一个简单的潜在机制:(分布内)泛化差距和外推差距之间的相互作用。我们通过使用 PAC-贝叶斯泛化界限的理论分析进一步支持这一机制。总的来说,我们的结果阐明了数据大小和难度如何共同影响 SFT 中泛化和外推之间的权衡,为某些模型和数据条件下基于难度的数据选择提供指导。