论文

BERTomelo:您的葡萄牙语编码器最好的朋友

BERTomelo: Your Portuguese Encoder Best Friend

模型训练预训练

摘要

编码器已成为多种 NLP 任务的最先进技术,尤其是那些需要深入上下文理解的任务。虽然多语言模型提供了广泛的覆盖范围,但专用的单语言编码器对于捕获特定语言独特的词汇和句法细微差别至关重要。然而,对于葡萄牙语来说,BERTimbau 和 Albertina 等现有的单语选项并没有跟上最近的架构突破,在可扩展性和效率方面往往落后于英语基准。这项工作介绍了 BERTomelo,这是一种从头开始预训练并专门针对葡萄牙语进行优化的下一代单语言编码器。通过利用 ModernBERT 架构,BERTomelo 克服了以前模型的局限性,提供了具有 1,024 个词元上下文窗口的 Base 和 Large 版本以及 FlashAttention 和交替注意力机制等硬件级优化。该模型在 ClassiCC-PT 上进行训练,这是一个包含 1.06 亿份文档的大型高质量葡萄牙语语料库,确保与该语言的当代用法保持高度一致。结果表明,BERTomelo 不仅优于以前的葡萄牙语编码器,而且还为 STS 和 NER 等下游任务中的大规模多语言模型提供了更强大、更高效的替代方案。