论文
基于约束的 预训练:从结构化约束到可扩展模型初始化
Constraint-based Pre-training: From Structured Constraints to Scalable Model Initialization
摘要
预训练 和 微调 范式已成为模型适应的主要方法。然而,传统的 预训练 通常会生成固定比例的模型,而实际部署通常需要不同尺寸的模型,当目标模型比例与 预训练 中使用的模型比例不同时,就会暴露出其局限性。为了解决这个问题,我们提出了一种创新的基于约束的 预训练 范式,该范式在 预训练 期间施加结构化约束,将与大小无关的知识分解为可重用的权重模板,同时将特定于大小的自适应分配给轻量级权重缩放器,从而将可变大小的模型初始化重新表述为多任务自适应问题。在此范例中,我们进一步引入 WeiT,它采用基于 Kronecker 的约束来规范 预训练 过程。具体来说,模型参数通过串联和加权聚合表示为权重模板的组合,并由轻量级权重缩放器控制自适应连接,其参数是从有限的数据中学习的。这种设计可以在不同的下游规模上灵活、高效地构建模型权重。大量实验证明了 WeiT 的效率和有效性,在广泛的感知和具体学习任务(包括图像分类、图像生成和具体控制)中初始化具有不同深度和宽度的模型时,实现了最先进的性能。此外,其有效性可推广到基于 Transformer 和基于卷积的架构,即使在全面训练的情况下,也能始终实现更快的收敛并提高性能。