论文

俄罗斯 ModernBERT 的领域适应长法律文件

Domain adaptation of Russian ModernBERT for long legal documents

模型训练持续学习

摘要

我们调查对俄罗斯立法文件的持续预训练是否可以改善俄罗斯 ModernBERT 法律文本编码器。改编后的模型 RuModernBERT-ruLaw 在语料库上进行了训练,据报道,该语料库包含 304,382 份立法文件和 194,425,905 份语料库token。 语料库token计数与模型分词器生成的位置不同。我们在 1,031 个法庭判决片段的固定外部集合上比较原始编码器和改编编码器。两个模型在五个掩蔽实现中的每一个中都接收相同的隐藏位置。在最大输入长度为 512、2,048 和 8,192 token时,平均屏蔽token交叉熵分别减少 0.10942、0.07052 和 0.06604 自然对数单位。报告的 95% 区间总结了该固定集合对掩蔽的敏感性;它们没有量化文档集合中的不确定性。第二项评估涉及法人实体提取。原始模型和改编模型的实体级 F1 分数分别为 0.99852 和 0.99820。然而,99.95% 的测试跨度在训练分割中具有相同的标准化表面形状和类别。因此,该评估提供了关于转移到以前未见过的形式的有限证据。该论文使用可编辑的图表和清晰标记的说明性示例解释了掩蔽目标、重叠窗口、平均规则和精确的实体边界评分。该比较支持所研究的模型和集合对的较低 masked-token预测损失。它不会孤立遥远背景的贡献或建立实际的法律效用。