论文

哪些任务可以在自我监督学习中生存?

Which Tasks Survive Self-Supervised Learning?

模型训练预训练

摘要

同实例自监督学习 (SSL) 通过强制同一底层实例的两个视图之间的一致性来学习表示。然而,仅这一原则并不能确定哪些下游任务仍然可以从学习的表示中恢复。我们通过语义可恢复性来研究这个问题,定义为所表示的函数空间捕获的任务后验分数的数量。我们表明,对于中心和白化表示,可恢复性准确地确定了方向类距离归一化方差(CDNV),控制了少样本最近质心分类,并控制了与任务相关的语义方向的强度。总体线性探针和质心轴重合,并且多个恢复良好的任务接近阶乘质心几何。然后,我们分析了规范的双视图 SSL 目标,并表明其总体最优跨越了相关双视图算子的主要跨视图稳定模式。这产生了语义可恢复性的封闭形式谱表征:下游任务被保留到其后验位于所选谱子空间中的程度。我们通过多种 SSL 方法在合成和真实数据集上验证这些预测,测试可恢复性、方向几何、光谱结构和少样本传输之间的预测关系。总之,这些结果给出了任务级说明,说明哪些信息在同实例 SSL 中幸存,以及保留的信息如何出现在下游几何和传输中。