论文
通过高效的跨尺度超参数传输缩放概率 Transformer
Scaling Probabilistic Transformer via Efficient Cross-Scale Hyperparameter Transfer
摘要
概率 Transformer (PT) 是一种用于上下文单词表示的白盒概率模型,在小型模型和中小型数据集上的计算结构和下游任务性能方面与标准 Transformer 具有很大的相似性。然而,PT 对超参数选择的鲁棒性不如标准 Transformer,因此更难以有效扩展。在这项工作中,我们遵循最大更新参数化(muP)来重新调整 PT 的参数,以便在小模型上优化的超参数可以转移到更大的模型上,而无需额外的调整。通过这种方法,我们成功地将 PT 扩展到参数高达 0.4B 的模型。实验表明,在相同的参数预算下,PT 在掩码语言建模 (MLM) 任务上始终优于标准 Transformer。我们希望这项工作将有助于未来更大范围内概率模型的实际部署。