论文
从大语言模型的角度重新思考数据混合
Rethinking Data Mixing from the Perspective of Large Language Models
摘要
数据混合策略对于 大语言模型 (LLM) 训练至关重要。经验证据表明,不适当的策略会显着降低泛化能力。尽管最近的方法提高了经验性能,但几个基本问题仍然悬而未决:域的构成是什么,人类和模型对域的感知是否一致,以及域权重如何影响泛化。我们通过在梯度动态和域分布之间建立正式联系来解决这些问题,提供一个理论框架来阐明域在训练动态中的作用。在此分析的基础上,我们引入了 DoGraph,这是一个重新加权框架,它将数据调度表述为图约束优化问题。对不同规模的 GPT-2 模型进行的大量实验表明,DoGraph 始终能够实现具有竞争力的性能。