论文
因果语言建模绕道改进编码器持续预训练
A Causal Language Modeling Detour Improves Encoder Continued Pretraining
摘要
当编码器适应新领域时,标准方法是继续使用掩码语言建模 (MLM) 进行训练。我们表明,暂时切换到因果语言模型 (CLM),然后短暂的 MLM 衰减可以提高下游性能。在使用 ModernBERT 的生物医学文本上,这种 CLM 迂回优于在 8 个法语和 11 个英语生物医学任务中训练的相同数据和计算的 MLM 基线,分别高出 +1.2-2.8pp 和 +0.3-0.8pp,具体取决于模型大小。我们调查这些收益的原因。我们发现 CLM 的密集监督对低 Transformer 层(0-7)的影响远远大于 MLM。在 CLM 期间冻结低层会消除下游效益;冷冻中间层可以保存它。即使 MLM 衰减阶段的长度与 CLM 阶段匹配,代表性变化也会持续存在,并且它们会随着模型容量的变化而变化。我们发布了 ModernCamemBERT-bio 和 ModernBERT-bio 作为最先进的基本尺寸和大尺寸生物医学编码器。