论文

一个模块,多个深度:具有深度编程专家的循环视觉Transformer

One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts

模型架构模型优化MoE递归架构蒸馏

摘要

在这项工作中,我们证明了循环应用的单个 Transformer 块可以在可比较的推理 FLOP 上与全深度视觉编码器的准确性相匹配,而无需中间特征蒸馏。 reViT 通过将每个循环深度的 FFN 表示为小型共享专家库的凸组合来恢复特定于深度的变换。连续归一化深度坐标对这种混合进行编程,通过 FFN 参数空间定义可重采样轨迹。我们通过两种方式评估此设计:监督 ImageNet-1k 训练和 DINOv2 教师的蒸馏。在这两种机制中,受控适应将权重空间合并确定为在匹配的 1-FFN 预算下经过测试的最强 MoE 系列,领先于token分发和输出混合替代方案。从头开始训练,reViT-B/16 达到 DeiT III 精度,存储参数减少约 70%。仅使用教师的输出特征提取的 8 专家模型保留了几乎所有 DINOv2 教师的线性探测精度以及跨分类、分割和深度预测的传输。 弹性深度训练允许一个检查点(训练模型)通过对相同的归一化坐标间隔重新采样来在多个测试深度上运行。对于固定深度部署,循环块可以具体化为传统的密集图,消除在线路由和合并,而不改变每深度一个 FFN 的计算,但扩展部署存储。