论文
daVinci-LLM:迈向预训练科学
daVinci-LLM:Towards the Science of Pretraining
摘要
基础预训练阶段决定了模型的能力上限,因为后训练难以突破预训练期间建立的能力基础,然而预训练仍严重缺乏研究。这源于一个结构性悖论:拥有算力资源的组织受商业压力抑制而无法透明公开,而学术机构拥有研究自由却缺乏预训练规模的算力资源。daVinci-LLM占据了这一未被探索的交叉点,将工业规模资源与完全的研究自由相结合,推进预训练科学。我们采用把开放作为科学方法论的完全开放范式,发布完整的数据处理流水线、全量训练过程与系统性探索结果。鉴于该领域缺乏系统化的数据处理方法学,我们采用Data Darwinism框架,一个从过滤到合成的原则性L0-L9分类体系。我们从随机初始化训练一个3B参数模型,跨8T token,采用从基础能力逐步转向推理密集增强的两阶段自适应课程。通过200多项受控消融,我们确立了:处理深度系统性地增强能力,是继规模扩展之后的关键维度;不同领域呈现不同的饱和动态,需要从比例调整到格式转换的自适应策略;成分配比平衡可实现定向强化同时防止性能崩塌;评估协议的选择塑造着我们对预训练进展的理解。通过发布完整的探索过程,我们使社区能够在我们的发现与系统方法之上继续构建,形成可积累的预训练科学知识。
