论文
IronViT:迈向高效的通才视觉表示学习
IronViT: Toward Efficient Generalist Visual Representation Learning
摘要
通用视觉编码器必须在统一的表示中捕获语义、空间、语言对齐和动作相关的线索,但当今最强大的视觉主干背后的 Softmax 注意力在高分辨率下变得异常昂贵。解决这两个挑战的自然尝试是将多个专业教师直接提炼成一个高效的架构。我们发现直接耦合这些目标会降低表示质量,因为学生必须同时协调异构功能并使它们适应不同的词元混合架构。我们介绍 IronViT,它建立在一个简单的原则之上:在限制计算之前整合功能。 IronViT 首先将互补的专家提炼成 softmax 注意力能力桥,然后逐步将合并的表示转移到混合的 softmax-线性注意力编码器。专门构建的数据管道进一步整理蒸馏语料库,以实现更高的信息密度和更广泛的领域覆盖范围。在识别、检索、密集预测、多模式理解和机器人学习方面,IronViT 与领先的专业和通才视觉编码器具有竞争力。 Softmax 桥在评估的骨干网中实现了多模态理解和机器人学习方面最强的总体性能,而混合编码器保留了广泛的传输性能,其效率优势随着输入分辨率的增加而增长。总之,这些结果表明,在架构转换之前整合功能可以产生通用的视觉编码器,而不会继承传统 softmax 注意力的令人望而却步的高分辨率成本。