论文
重新思考由易到难:后训练 演绎推理课程学习的局限性
Rethinking Easy-to-Hard: Limits of Curriculum Learning in Post-Training for Deductive Reasoning
摘要
课程学习(CL)的动机是按照难度递增的顺序学习应该易于泛化,在 预训练 和 大语言模型 (LLM) 的 后训练 中普遍采用。 CL 的直觉对于组合推理尤其引人注目,其中复杂的问题是根据基本推理规则构建的;然而,CL 对此类任务的实际影响在很大程度上仍未得到充分探索。我们使用综合算术和逻辑基准对 后训练 和 LLM 的 CL 进行了系统的实证研究,其中难度的特征是推理复杂性而不是表面级代理。令人惊讶的是,在多个模型系列和课程安排中,我们发现基于难度的测序在准确性或响应长度方面与标准随机抽样相比没有强大的优势。这些发现在监督 微调 (SFT) 和强化学习 (RL) 方法中都存在。我们的研究表明,在演绎推理的背景下,训练示例的特定顺序在实现组合泛化方面的作用可以忽略不计,这对基于课程的 后训练 的实际效用提出了挑战。