论文
关于自监督 预训练 的渐进性:两阶段 M 估计和表示对称性
On the Asymptotics of Self-Supervised Pre-training: Two-Stage M-Estimation and Representation Symmetry
摘要
自监督 预训练 使用大量未标记数据来学习下游 微调 的表示,已成为现代机器学习的基石。虽然越来越多的理论工作已经开始分析这一范式,但现有的界限仍然存在以下问题:当前的利率有多陡,以及它们是否准确地捕捉了 预训练 和 微调 之间的复杂相互作用。在本文中,我们通过两阶段 M 估计开发 预训练 的渐近理论来解决这一差距。一个关键的挑战是 预训练 估计器通常只能识别群对称性,这是表示学习中常见的特征,需要仔细处理。我们使用黎曼几何工具来研究 预训练 表示的内在参数来解决这个问题,我们通过轨道不变性的概念将其与下游预测器联系起来,精确地表征下游测试风险的极限分布。我们将我们的主要结果应用于几个案例研究,包括频谱 预训练、因子模型和高斯混合模型,并在适用时在特定问题的因子方面获得了相对于现有技术的实质性改进。