论文

预测和重建:自监督语言表征学习的联合目标

Predict and Reconstruct: Joint Objectives for Self-Supervised Language Representation Learning

模型训练预训练

摘要

自 BERT 以来,掩码语言建模 (MLM) 一直是文本编码器的主要 预训练 目标,但它鼓励强烈锚定于表面形式标记身份而不是更深层次语义结构的表示。受到视觉和音频领域联合嵌入预测架构(JEPA)(LeCun,2022)成功的启发,我们提出了一种混合 预训练 目标,它将 JEPA 式潜在空间预测损失与单个共享编码器上的标准 MLM 目标相结合。可学习的标量参数在训练期间不断平衡两个目标。我们使用相同的架构和计算预算 (NVIDIA H100) 在英语维基百科上预训练混合模型和纯 MLM 基线。使用四种池化策略对五个 GLUE 基准(SST-2、MRPC、MNLI、CoLA、STS-B)进行广泛的表示分析表明,混合编码器产生明显更均匀的嵌入(MLM 的均匀度小于 -0.16 与 -0.05),在最大池化下表现出更丰富的频谱几何,编码更少的表面级词汇信息,并实现更好的语义到词汇平衡。尽管线性探针下游精度相似,但几何差异是一致且显着的,这表明 JEPA 预测目标以标准精度指标无法捕获的方式重塑了潜在空间。