论文

始终学习,始终混合:始终高效且简单的数据混合

Always Learning, Always Mixing: Efficient and Simple Data Mixing All The Time

模型训练合成数据

摘要

数据混合决定如何组合不同来源或类型的数据,并且是整个语言 模型训练 中的一个必然问题。在预训练中,数据构成是模型质量的关键决定因素;在不断的学习和适应中,它控制着保留和获得的内容。然而,现有的数据混合方法一次仅解决此生命周期的一个阶段:一些方法需要与单个训练阶段相关的较小代理模型,另一些方法假设固定的领域集,并且持续学习完全缺乏原则指导。我们认为,数据混合从根本上来说是一个在线决策问题——一个在整个训练过程中反复出现的问题,需要一个单一的、统一的解决方案。我们引入了 OP-Mix (同策略 Mix),这是一种在整个语言 模型训练 生命周期中运行的数据混合算法。我们的主要见解是,可以通过在直接在当前模型上训练的低秩适配器之间进行插值来廉价地模拟候选数据混合物,消除单独的代理模型并确保搜索始终基于模型的实际学习动态。在预训练、持续训练中和持续指令调整中,OP-Mix 在使用基线计算的一小部分的同时始终找到接近最佳的混合。在预训练中,OP-Mix 比不混合训练的平均困惑度提高了 6.3%。对于持续学习,OP-Mix 与再训练和 同策略 蒸馏 的性能相匹配,同时总体计算量分别减少 66% 和 95%。 OP-Mix 提出了一种不同的语言观点 模型训练:不是一系列不同的阶段,而是从数据中学习的单个连续过程。