论文

使用子词正则化预训练语言模型:低资源 NLP 中 BPE Dropout 的实证研究

Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP

模型训练预训练

摘要

BPE dropout 等子字正则化方法通常仅在 微调 期间应用,而预训练通常通过确定性标记化完成。这会在预训练和 微调 之间造成潜在的分段不匹配。我们研究在预训练期间应用 BPE dropout 是否可以提高低资源 NLP 中的下游性能。我们在英语、德语、法语、西班牙语、斯瓦希里语和 isiXhosa 的下采样子集上训练单语和双语 BERT 模型,并在 XNLI、PAWS-X、PAN-X 和 MasakhaNER 2.0 上对其进行评估。在各种任务中,当在预训练和 微调 期间应用随机标记化时,通常会获得最佳结果,而仅在 微调 期间应用 BPE dropout 可能会在较小数据设置中表现不佳。随着 微调 数据的增加,这个缺点会减弱,而当预训练或 微调 数据稀缺时,预训练时 BPE dropout 的好处是最大的。 BPE dropout 的好处通常归因于更好的组合表示,尤其是对于稀有单词。为了检查这一点,我们测量了 BPE dropout 下的形态边界对齐,发现预期对齐仅略有改善,而对齐更好的分割仍然很少。这表明 微调 单独提供的此类分割的暴露程度可能有限,而预训练过程中的随机标记化则可以更一致地将模型暴露给它们。我们进一步表明,在 微调 期间选择性地引入形态对齐的分割主要提高了没有 BPE dropout 的预训练模型的性能。总体而言,这些发现表明,接触更好对齐的分割可能有助于在预训练期间应用 BPE dropout 带来下游效益。