论文
RoLegalGEC:罗马尼亚语法律领域语法错误检测和纠正数据集
RoLegalGEC: Legal Domain Grammatical Error Detection and Correction Dataset for Romanian
摘要
法律文件中清晰正确的文本的重要性不可低估,因此,旨在协助法律专业人士的语法错误纠正工具必须能够理解法律环境中可能出现的错误,并进行相应的纠正,并且隐含地需要在相同的环境中使用现实的法律数据进行培训。然而,这种过程所需的手动注释数据对于罗马尼亚语等语言来说是供不应求的,更不用说对于利基领域了。最常见的方法是并行数据的合成生成;然而,它需要对罗马尼亚语语法有结构化的理解。在本文中,据我们所知,我们介绍了第一个用于检测和纠正法律领域语法错误的罗马尼亚语并行数据集 RoLegalGEC,该数据集聚合了 350,000 个法律段落中的错误示例以及错误注释。此外,我们评估了几种神经网络模型,这些模型将数据集转换为检测和纠正语法错误的有价值的工具,包括知识蒸馏 Transformer、用于检测的序列标记架构以及用于纠正的各种预训练的文本到文本Transformer模型。我们认为这组模型与新颖的 RoLegalGEC 数据集将丰富罗马尼亚语进一步研究的资源库。