论文

模型链 预训练:重新思考视觉基础模型的训练加速

Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models

模型训练预训练

摘要

在本文中,我们提出了模型链 预训练 (CoM-PT),这是一种用于视觉基础模型 (VFM) 的新型性能无损训练加速方法。这种方法与现有加速方法的根本区别在于其核心动机:CoM-PT 不是单独优化每个模型,而是旨在加速模型系列级别的训练流程,随着模型系列的扩展而有效扩展。具体来说,CoM-PT为模型族建立一个预训练序列,按照模型大小升序排列,称为模型链。在这条链中,只有最小的模型经历标准个体预训练,而其他模型通过联合重用参数空间和特征空间中的知识,通过来自较小前身的顺序逆知识转移来有效地训练。因此,CoM-PT 使所有模型都能实现优于标准单独训练的性能,同时显着降低训练成本,并且这在涵盖零样本和 微调 任务的 45 个数据集上得到了广泛验证。值得注意的是,其高效的扩展特性产生了一个显着的现象:训练更多的模型甚至会带来更高的效率。例如,当 CC3M 上的 预训练 时: i) 将 ViT-L 作为最大模型,逐步将较小的模型添加到模型链中,可将计算复杂度降低高达 72%; ii) 在固定模型尺寸范围内,随着 VFM 系列扩展到 3、4 和 7 个模型,CoM-PT 的加速比呈现出惊人的飞跃:从 4.13X 到 5.68X 和 7.09X。由于 CoM-PT 自然不可知于特定的 预训练 范例,因此我们将代码开源,以促进计算密集型场景中的进一步扩展,例如 大语言模型 预训练。