论文
预训练表示的最佳维度取决于数据量和下游任务
Optimal Representation Size: High-Dimensional Analysis of Pretraining and Linear Probing
摘要
学习从有限的数据中进行泛化对于人工系统和生物系统来说都是一个根本性的挑战。一种常见的策略是从丰富的无标注数据中提取可重用的结构,从而能够从有限的标记数据中有效地适应新任务。这种两阶段范例现在是现代训练管道的标准,其中预训练之后是 微调 或线性探测。我们提供了这个过程的分析模型:结构提取被形式化为对无标注数据的主成分分析,下游学习被形式化为对单独标记数据集的线性回归。在高维体系中,我们推导了训练和泛化误差的精确表达式,展示了它们对表示维数、无标注和标记样本大小以及任务对齐的依赖。我们的结果表明,预训练表示强烈影响下游泛化,并且我们将最佳表示大小描述为任务参数的函数:在预训练数据丰富但下游数据稀缺的情况下,最大压缩表示是最佳的,而在预训练数据有限的情况下,高维表示泛化得更好。此外,我们在预训练和监督之间建立了精确的权衡,量化了替换单个标记样本所需的无标注数据。除了我们的理想化模型之外,我们在自动编码器和预训练的 LLM 中观察到类似的现象。总而言之,我们强调优化表示大小至关重要,为预训练期间的压缩提供了改善泛化的条件。