论文

微型中文BERT预训练:MLM、全词掩码与MacBERT的受控比较

Tiny-Scale Chinese BERT Pretraining: A Controlled Comparison of MLM, WWM, and MacBERT Strategies

模型训练模型优化预训练小模型/轻量模型

摘要

预训练策略显着影响语言模型的质量,但现有的掩码语言建模 (MLM)、全字掩码 (WWM) 和 MacBERT 式替换的比较主要集中在基本规模模型(>=110M 参数)。本文在微型中国 BERT 模型(4 层、256 个隐藏维度、870 万个参数)上对这三种策略进行了受控比较。在相同的架构、语料库(来自中文维基百科的 129 万个句子)和超参数下,我们从头开始训练三个模型,并在五个内在维度上对其进行评估:困惑度、MLM 命中率、语义辨别、语法判断和上下文敏感性。在小规模上,MLM 实现了最佳的整体内在性能(赢得 5 个维度中的 3 个),而 WWM 在困惑度(1.27 比 2.10,提高 39.5%)和 MLM 命中率(22% 比 16%)方面表现出色。值得注意的是,MacBERT 在严格有限的同义词词典(222 个条目,3.3% 覆盖率)下表现出严重的困惑度下降(47.23,比 MLM 高 22 倍),产生的排名(MLM > WWM >> MacBERT)与既定的基本规模结论(MacBERT > WWM > MLM)明显不同。我们进一步确定了一个关键的评估陷阱:MacBERT 实现了最低的训练损失(2.17)但最高的困惑度(47.23),这表明仅训练损失在混合替换策略下是不可靠的。所有模型和语料库均可在 https://huggingface.co/eebyp。 上公开获取