论文

掩码重采样的优势:掩码自编码器的理论与实验

The hidden advantage of mask resampling: a theory of masked autoencoders

模型训练预训练

摘要

为什么掩码预测能学到无掩码重建遗漏的有效表示?本文在共享潜在结构、异质噪声数据上的高维掩码自编码器(MAE)模型中研究这一问题,证明在无掩码线性重建(等价于PCA)失败的情形下,掩码线性重建可用线性样本复杂度恢复潜在特征。分析还量化了掩码预训练中重采样的统计优势:为每个样本设置固定的K个掩码,刻画其对特征恢复和下游表现的影响,并识别出增加掩码多样性可降低样本复杂度的条件。实验发现,标准图像训练中的随机裁剪和翻转,即使在图像块掩码固定时也会更新预测任务,从而掩盖掩码重采样的优势。去除这些变换后,CNN自编码器与视觉Transformer的动态掩码在下游任务中优于静态掩码。BERT探索性实验也发现,提高掩码多样性有利于下游语言任务。研究区分了掩码预测目标与掩码多样性各自的收益,并展示如何用可分析的理论指导实验,发现常规训练设置掩盖的优势。