论文
通过贝叶斯域重新加权发挥优化数据混合的潜力
Harnessing the Potential of Optimizing Data Mixtures via Bayesian Domain Reweighting
摘要
大语言模型 (LLM) 的性能从根本上受到多域 预训练 数据的分布组成的影响。虽然手动启发式方法在早期模型中很普遍,但随着数据复杂性的增长,它们越来越无法捕捉领域之间复杂的协同作用。为了克服这个问题,主要方法寻求拟合域权重与其相应的验证损失之间的代理函数映射,然后找到最佳域权重以最小化验证损失。这些方法依赖于强大的结构假设,例如等级不变性或缩放定律,这些假设经常被违反,从而导致不可忽略的估计偏差。一种有前途的方法是直接根据数据优化加权方案。然而,它受到不稳定的优化轨迹和过高的计算开销的影响,限制了其搜索更好的域权重配置的潜力。本文提出了一种贝叶斯域加权方法,通过引入从观测中学到的伽玛先验信息,从狄利克雷分布中推断权重。实验结果表明,所提出的方法可以实现稳定有效的域权重学习,并识别最佳混合,同时消耗的数据比基于搜索的函数拟合方法少得多,从而为大规模应用重振基于优化的域权重。