论文
程序核心:视觉Transformer的紧凑循环初始化
Procedural Core: A Compact Recurrent Initialization for Vision Transformers
摘要
Transformer通常是从随机初始化开始训练的,要求它们的所有功能都来自大规模优化。最近的工作表明,少量抽象程序生成的数据可以帮助以低成本获取通用归纳结构。然而,这增加了必须对每个目标模型重复的预训练阶段。我们提出了 Procedural Core,这是一种初始化策略,它将这种通用结构捕获为一组紧凑的权重,可以在模型之间重复使用。我们在程序数据上训练最小循环Transformer,然后扩展其权重以初始化任意宽度和深度的Transformer。由此产生的初始化提高了图像分类、自监督视觉学习 (DINO) 以及自然语言建模 (FineWeb-Edu) 和代码 (CodeParrot) 的性能。对于图像分类,扩展 1M 参数核心来初始化 85M 参数 ViT-Base 比标准随机初始化提高了 2.2 pp 的 ImageNet top-1 精度。我们的分析表明,递归对于学习跨模型转移的紧凑权重至关重要。在 ViT 中,我们定位了抑制高范数标记的一个关键优势,该优势在零样本分割(ImageNet-S mAP 32.3 至 42.9)、对象定位(VOC07 CorLoc 9.9 至 18.4)和深度估计(NYUv2 RMSE 1.104 至 0.998)方面产生了实质性改进。这表明Transformer不需要从零开始,并且可以以低成本使用通用功能进行初始化,而无需特定于域或任务的数据。