论文
JetViT:高效高分辨率视觉 Transformer 与 后训练 注意力搜索
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
摘要
我们推出 JetViT,这是一个新颖的混合架构视觉 Transformer (ViT) 模型系列,其精度可与最先进的全注意力视觉基础模型相匹配,同时在高分辨率图像上实现更高的推理效率。我们方法的核心是 后训练 注意力搜索,这是一个 后训练 加速框架,通过识别冗余全注意力块并将其替换为线性或窗口注意力块,将预先训练的全注意力 ViT 转换为高效的混合注意力变体。通过继承基础模型的 MLP 和注意力权重,后训练 注意力搜索通过三个关键步骤有效地探索架构设计空间:(1)优化线性注意力模块设计; (2)找到线性注意力和窗口注意力块的最佳组合; (3) 识别和保存关键的全注意力块。我们在两个代表性的高分辨率视觉基础模型 DINOv3 和 DepthAnythingV2 上评估 JetViT。在 NVIDIA H100 GPU 上,JetViT 在不牺牲准确性的情况下实现了高达 1.79 倍的吞吐量提升和高达 44.81% 的延迟降低。我们将很快发布我们的代码和加速的 ViT 模型。