论文
推理数据选择的能力依赖性效应
Capacity-Dependent Effects of Data Selection for Reasoning
摘要
在推理监督 微调 中,考生对同一指令的反应在与学生当前分布的匹配程度方面可能存在很大差异。最近基于可能性的响应选择方法表明,更接近学生分布的响应提供了更有效的监督,激发了这样的假设:高可能性响应通常可能更适合 微调。在本文中,我们重新审视了这种直觉,并表明基于可能性的数据选择的价值关键取决于模型容量和训练持续时间。通过数学推理的受控实验,使用从 1.5B 到 8B 的学生参数以及更强的教师模型生成的监督,我们观察到明显的 \emph{capacity-dependent} ``{\color{SMALLCOLOR}\textbf{Fast-Fit}} / {\color{LARGECOLOR}\textbf{Slow-Gain}}'' 模式。高似然数据提供更快、更稳定的早期改进,特别是对于较小的模型,但当允许训练持续更长时间时,低似然数据对于较大的模型变得越来越有利。为了解释这一现象,我们分析了学习动态,结果表明,小模型往往无法吸收低似然监督,而是陷入浅层或重复行为,而较大的模型在此类数据下能够更好地趋向教师分布。我们进一步提供了 蒸馏 的容量约束理论视图,阐明了数据难度、数据跨度和学生容量如何共同控制传输。总的来说,我们的研究结果表明,用于推理的有效数据选择应该了解模型容量和计算预算,而不是基于对高似然监督的单一普遍偏好。