论文

提炼视觉 Transformer 用于失真鲁棒表示学习

Distilling Vision Transformers for Distortion-Robust Representation Learning

摘要

自监督学习在从干净的数据中学习视觉表示方面取得了显着的成功,但当干净的观察稀疏或根本不可用时仍然具有挑战性。在本文中,我们证明了可以利用预训练的视觉模型来学习失真鲁棒表示,然后可以有效地将其应用于对失真观测进行操作的下游任务。特别是,我们提出了一个非对称的 知识蒸馏 框架,其中教师和学生都从相同的预训练视觉 Transformer 初始化,但接收每个图像的不同视图:教师处理干净的图像,而学生看到其扭曲的版本。我们引入了多级 蒸馏 来对齐全局嵌入、补丁级特征和注意力图,并表明学生能够近似干净图像表示,尽管从未直接访问干净数据。我们在多个数据集和各种扭曲下评估我们的图像分类任务方法,在相同数量的人类监督下,始终优于现有的替代方案。