论文
将表示与重建分离可实现可扩展的文本编码器
Separating Representation from Reconstruction Enables Scalable Text Encoders
摘要
虽然解码器规模迅速扩大,但编码器自 BERT 以来基本保持不变。我们通过探测冻结主干评估来重新审视这种差异。在这个镜头下,尽管困惑度有所提高,但 BERT 编码器的表示变得越来越无法被冻结探针利用。这种错位源于 BERT 的扁平化设计,它将表示学习与 token 重建损失结合起来。我们提出 $\textbf{CrossBERT}$,这是一个由两部分组成的架构,它将高质量编码表示的学习与词元重建的严格基础分开。该设计进一步通过 $\textit{互补掩码策略}$ 实现高掩码率 ($\ge 50\%$) 和所有词元的梯度收集,分别将吞吐量提高 $1.5$ 至 $2\times$,并将样本效率提高 $2\times$。总体而言,CrossBERT 在 MTEB(eng、v2)和冻结的 GLUE 基准测试上展示了单调缩放和卓越性能。