论文

后训练博士:LLM 后训练的数据正则化视角

Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

模型训练监督微调与指令调优

摘要

数据选择方法解决了 LLM 后训练 中的一个关键挑战:有效利用稀缺的高保真目标数据以及丰富但不完全对齐的一般训练数据。在这项工作中,我们超越了数据选择框架,引入了 后训练 博士(数据正则化 后训练),这是一种新颖的框架,它将一般训练数据重新概念化为数据诱导的正则化器,防止过度拟合稀缺的目标目标,而不是充当选择池。具体来说,我们的框架建议在每个训练步骤中,使用通用训练数据构建一组可行的模型更新方向,并将稀缺目标数据指定的模型更新方向投影到该可行集合上。标准训练和现有的数据选择方法是作为数据诱导正则化器的不同选择的特殊情况而出现的,并且这些方法对应于具有不同正则化强度的偏差-方差谱上的不同点。基于这一观点,我们提出了一系列方法,提供更丰富的设计空间和更灵活的偏差-方差权衡。对于 LLM 规模的实际使用,我们引入了仔细的系统优化,以最小的开销实现这些方法。 SFT、RLHF 和 RLVR 的广泛实验表明,我们的方法始终优于最先进的数据选择基线,并且系统基准测试证实了它们的效率。