论文

ANNOTARES:用于从德国法定文本中提取逻辑结构的数据集

ANNOTARES: A Dataset for Extracting Logical Structures from German Statutory Texts

模型评测基准与评测资源

摘要

法律文本的自动结构分析是法律技术的基石,但其逻辑成分的提取仍然是一个重大挑战。在本文中,我们介绍了在德国法定文本中识别和分割法律条件(Tatbestand)和法律后果(Rechtsfolge)的任务。为了支持这项任务,我们提出了 ANNOTARES(Tatbestand-Rechtsfolge 序列注释),这是一个包含德国法律文本和跨度注释的新颖数据集。该数据集跨越三个不同的法律法规,旨在评估特定领域的性能和跨法规的普遍性。我们对不同的架构方法进行基准测试:基于规则的基线、CRF、BiLSTM、BiLSTM-CRF 和基于现代 Transformer 的模型,包括 BERT 变体和基于 LLM 的方法。我们的结果表明,基于 BERT 和 LLM 的模型在捕获法律语言的复杂句法结构方面取得了优异的性能。我们发布数据集以促进自动法律推理的进一步研究。