论文

波兰语 ModernBERT:波兰语理解的长与短

Polish ModernBERT: The Long and Short of Polish Language Understanding

模型训练预训练

摘要

仅编码器 Transformer 对于判别和表示学习任务仍然有效,但波兰编码器仍然很大程度上依赖于 BERT/RoBERTa 风格的架构。我们引入了 \textbf{Polish ModernBERT},这是一个由四个波兰编码器组成的系列,可用于基础和大规模,每个编码器都有 512 个词元和 8K 上下文变体。我们通过阶段性选择实验来调整 ModernBERT 预训练方案,并发布了涵盖法律主题分类、意识形态决策方向预测、文学情节摘要的事实一致性评估以及侵犯人权评估的长上下文基准。在 30 项任务中,Polish ModernBERT 在评估的 Polish 编码器中取得了最佳的整体性能,Base-8K 和 Large-8K 模型分别达到 83.99 和 85.11。在长上下文任务中,8K 变体比匹配的波兰 RoBERTa-8K 基线在基础和大尺度上分别从 67.47 提高到 77.15 和从 75.88 提高到 78.49。 Base-8K 模型以减少 22% 的参数实现了这一增益(149M vs. 190M)。代表性推理设置中的效率测量显示,在 512 个词元和 8K 设置中,峰值内存使用率和延迟均低于匹配的波兰 RoBERTa 基线。 Polish ModernBERT-8K-Base还在波兰检索基准上在低于300M参数的评估编码器中取得了最佳结果。