论文
零数据自博弈预训练
Self-Play Pretraining with Zero Data
摘要
语言建模的进展一直由在越来越多的数据上进行预训练扩展所驱动。然而,训练数据在很大程度上仍是为模型精心挑选的。更通用的预训练方式应当让模型学会生成对自身改进最有用的数据。这将提供实际上无上限的训练数据来源,其上限是算力而非人类知识。我们提出零数据自博弈预训练(Self-Play Pretraining with Zero Data),这是实现该愿景的一个初步概念验证。受所罗门诺夫归纳启发,我们的方法将合成数据生成转化为对所有可计算结构空间的搜索。从随机初始化出发,两个模型协同学习:生成器提出由通用图灵机解释的程序,生成字节序列;学习器则以自回归方式预测这些字节序列。学习器用标准交叉熵训练,生成器则通过强化学习训练,以产生处于学习器能力前沿的序列,从而形成自适应课程。通用图灵机为我们提供了覆盖所有可计算数据生成过程的搜索空间,几乎不施加领域特定结构,自博弈则在这个空间中搜索有用的训练数据。我们检验了自然数据上的零样本性能是否随自博弈算力可预测地提升;由于生成器与学习器均未在自然数据上训练,这是对迁移能力的一次干净检验。在多个自然数据集上,零样本损失表现出随算力的可预测扩展。模型还展现出上下文学习能力,并在训练过程中发现了可识别的数学序列。
