论文

moBERTo:通过 ModernBERT 的持续预训练实现的现代葡萄牙语编码器

moBERTo: A Modern Encoder for Portuguese via Continued Pretraining of ModernBERT

模型训练预训练

摘要

仅编码器的 Transformer 模型对于生产 NLP 管道仍然至关重要。我们引入了 moBERTo,这是 ModernBERT 的葡萄牙语版本,是通过对 600 亿个词元(在 FineWeb2 中整理的 120 亿词元语料库上进行了 5 个时期,并使用教育和 STEM 分类器进行过滤)对基于 ModernBERT 的检查点进行持续预训练而获得的。我们保留了原始的架构,包括旋转位置嵌入、交替局部全局注意力、闪光注意力和取消填充。我们在信息检索(包括最多 8,192 个标记的长上下文检索)、文档分类、命名实体识别和自然语言理解方面评估 moBERTo。我们的最佳变体将葡萄牙语分词器与子词匹配嵌入传输和长上下文 后训练 相结合,在三个葡萄牙语检索基准中实现了最高平均重新排名 nDCG@10 以及 PLUE-PT 上的最佳结果。通过消融研究,我们表明(i)持续预训练比从头开始训练更可取,特别是对于保留长上下文能力; (ii) 分词器自适应改进了 词元级 任务,但降低了长上下文检索; (iii) 8,192 个词元的专用长上下文 后训练 阶段进一步改进了重新排名和 NER; (iv) 对于判别任务,仅编码器架构与更大的仅解码器替代方案仍然具有竞争力。我们在 Hugging Face 上公开发布了模型权重 https://huggingface.co/Tropic-AI/moBERTo 和训练数据 https://huggingface.co/datasets/Tropic-AI/moberto-pretraining-dataset-c4-complete。