论文
OptiMer:对于连续 预训练,最优分布向量合并优于数据混合
OptiMer: Optimal Distribution Vector Merging Is Better than Data Mixing for Continual Pre-Training
摘要
连续 预训练 被广泛用于使 LLM 适应目标语言和领域,但训练数据的混合比仍然是一个敏感的超参数,调整成本很高:它们必须在训练开始之前修复,并且次优的选择可能会浪费数周的计算时间。在这项工作中,我们提出了 OptiMer,它将比率选择与训练解耦:我们为每个数据集训练一个 CPT 模型,提取每个模型的分布向量(表示由该数据集引起的参数变化),并通过贝叶斯优化事后搜索最佳组合权重。 Gemma 3 27B 跨语言(日语、中文)和领域(数学、代码)的实验表明,OptiMer 始终优于数据混合和模型平均基线,搜索成本低 15-35 倍。主要发现表明:1) 优化后的权重可以解释为数据混合比率,使用这些比率进行再训练可以提高数据混合 CPT,2) 可以针对给定目标重新优化相同的向量池,而无需进行任何再训练,从而按需生成目标定制模型。我们的工作表明,数据混合比选择(传统上是 预训练 决策)可以重新表述为分布向量的事后优化,为连续 预训练 提供更灵活的范例。