论文
Climate-ModernBERT:重新审视语料库构成以进行领域自适应持续预训练
Climate-ModernBERT: Revisiting Corpus Composition for Domain-Adaptive Continued Pretraining
摘要
气候领域的自然语言处理 (NLP) 需要模型来处理异构文本源,包括科学文献、政策披露和综合报告。然而,如何在持续预训练(CPT)过程中有效地结合不同领域的语料库仍有待探索。我们介绍了 Climate-ModernBERT,这是一系列适应气候的编码器模型,是通过 ModernBERT-Base 对三个气候语料库的持续预训练而获得的:学术气候文本、气候过滤的网络数据和合成气候文档。我们系统地将语料库混合物的联合持续预训练与独立专业检查点的参数空间合并进行比较。在 9 个气候 NLP 基准中,我们的最佳模型达到了 76.3 的平均 F_1,比普通的 ModernBERT 基准显着提高了 2.8 个百分点。在气候 NLP 设置中,结果表明,学术气候语料库在评估的来源中提供了最强的适应信号,而参数空间合并改进了联合多源训练,并更好地保留了来自异构气候语料库的补充信息。我们发布了所有 Climate-ModernBERT 变体和训练检查点,以支持气候 NLP 和领域自适应预训练的未来研究。