论文

OptiSelect:优化器如何塑造数据课程

OptiSelect: How does the Optimizer Shape Data Curriculum?

模型训练预训练

摘要

在线数据选择通过在每批内训练最有价值候选,已为LLM预训练展示显著效率增益。由于候选的价值经由其有效模型更新实现,有原则的选择应计入优化器步——它在更新模型参数前重塑原始梯度。我们把这一优化器感知的选择范式形式化为OptiSelect,并呈现首个关于优化器如何塑造数据选择的系统研究。理论确立选择增益原理:在线选择的优势由优化器诱导效用分数的判别力支配。我们证明Lion与Muon的基于符号与极切向预条件子会遭受判别力坍缩——封顶OptiSelect可得的增益,而AdamW与Sophia等对角自适应优化器允许严格更好的上界。该原理还定量导出最优候选过采样比。124M与720M模型的预训练实验与理论分析一致,并显示即使以Muon为优化器,AdamW的对角自适应打分几何仍是最强打分几何。我们进一步证明OptiSelect在数据改写(现代数据处理管道使用的技术)下保持其收益。发现为LLM预训练中优化器与数据选择的协同设计提供理论基础与实践指导。