论文
面向掩码语言建模的熵感知掩码
Entropy-aware Masking for Masked Language Modeling
摘要
掩码语言建模已成为训练基于编码器的语言模型的标准预训练目标。在该方法中,输入中的某些词元被掩码,模型学习利用周围上下文来预测它们。这一过程使模型能够捕捉语言的句法与语义属性。通常,被选中掩码的词元是随机选取的,这不一定总能产生最有效的学习信号。本文研究一种基于熵分布的词元掩码策略。我们利用模型对词元预测的熵来确定哪些词元应被掩码。该方法旨在锁定信息量更大、更不确定的词元,以提升训练效能。我们还提出一种新颖的自掩码方法,无需依赖外部参考模型即可提升训练效率。实验结果表明,与基线相比,我们的方法在GLUE分数上平均提升5%。此外,我们尝试将知识蒸馏与熵掩码相结合,取得了最佳的整体结果。
