论文
HUKUKBERT:土耳其法律领域特定语言模型
HUKUKBERT: Domain-Specific Language Model for Turkish Law
摘要
自然语言处理 (NLP) 的进步为一代法律科技系统提供了动力,但土耳其法律仍然缺乏特定领域数据和模型的服务。英语有合法的编码器如LEGAL-BERT;土耳其不存在可比的高容量对应产品。我们引入了 HukukBERT,这是一种土耳其法律语言模型,使用混合了全字屏蔽、词元跨度屏蔽、词跨度屏蔽和目标关键词屏蔽的混合域自适应 预训练 (DAPT) 配方在 19 GB 清理语料库上进行训练。我们将 48K WordPiece 分词器和 DAPT 管道与通用和现有的特定领域土耳其语模型进行了比较。在法律完形填空测试(针对土耳其法院判决的隐藏法律术语预测基准)中,HukukBERT 达到了 84.40% 的 Top-1 准确率,并且超过了我们测试的所有基线。法律完形填空测试是综合构建的,因此通过构建,预训练 语料库中不存在其段落,从而消除了训练测试污染。在下游土耳其法院官方判决的结构分割任务上,文件通过率达到92.8%。我们发布HukukBERT来支持土耳其法律NLP在命名实体识别、判断预测和文档分类方面的工作。