论文

零数据自博弈预训练

Self-Play Pretraining with Zero Data

模型训练预训练

摘要

语言建模的进展一直由在越来越多的数据上进行预训练扩展所驱动。然而,训练数据在很大程度上仍是为模型精心挑选的。更通用的预训练方式应当让模型学会生成对自身改进最有用的数据。这将提供实际上无上限的训练数据来源,其上限是算力而非人类知识。我们提出零数据自博弈预训练(Self-Play Pretraining with Zero Data),这是实现该愿景的一个初步概念验证。受所罗门诺夫归纳启发,我们的方法将合成数据生成转化为对所有可计算结构空间的搜索。从随机初始化出发,两个模型协同学习:生成器提出由通用图灵机解释的程序,生成字节序列;学习器则以自回归方式预测这些字节序列。学习器用标准交叉熵训练,生成器则通过强化学习训练,以产生处于学习器能力前沿的序列,从而形成自适应课程。通用图灵机为我们提供了覆盖所有可计算数据生成过程的搜索空间,几乎不施加领域特定结构,自博弈则在这个空间中搜索有用的训练数据。我们检验了自然数据上的零样本性能是否随自博弈算力可预测地提升;由于生成器与学习器均未在自然数据上训练,这是对迁移能力的一次干净检验。在多个自然数据集上,零样本损失表现出随算力的可预测扩展。模型还展现出上下文学习能力,并在训练过程中发现了可识别的数学序列。

零数据自博弈预训练:论文配图
图 1:零数据自博弈预训练。从随机初始化的模型出发、仅使用合成生成的数据,自博弈在留出的自然数据上产生可预测的扩展性。(上)我们的流程将合成数据生成转化为在可计算结构空间中的搜索。生成器提出程序,程序被执行以产生字节序列,用于通过下一 token 预测训练学习器。生成器经由强化学习训练,使其提出的程序靠近学习器能力的前沿——以学习器梯度与其近期学习轨迹在 AdamW 预条件内积下的对齐程度来衡量。(左下)自博弈在多个自然数据集上带来随算力可预测改善的验证损失。我们展示了在模型规模、自博弈轮数与集成规模上的计算最优前沿。(右下)所得学习器在不进行任何梯度更新的情况下,在留出任务上表现出上下文学习能力。我们报告贪婪解码下作为上下文示例数量 m 之函数的经验成功率,并在独立采样的任务实例上取平均。