论文
用跨难度知识迁移解释并改进大模型课程学习
Understanding Curriculum Learning in Large Language Models via Cross-Difficulty Optimization Dynamics
摘要
课程学习按由易到难组织数据,已广泛用于大模型后训练,但收益随推理任务变化,说明不存在普遍最优课程。研究分析不同课程安排引起的优化动态,发现难度层级间的知识迁移关系可解释调度效果,并将其形式化为“相对迁移”。据此提出迁移感知动态课程采样TDCS,在训练过程中按估计迁移关系调整采样分布。多项推理基准显示,方法在不同任务、模型规模和训练范式中持续优于代表性调度策略,同时以跨难度迁移提供统一的优化解释。