论文

在句子层面对解释规范进行分类:德国联邦宪法法院的基准

Classifying Interpretive Canons at the Sentence Level: A Benchmark from the German Federal Constitutional Court

模型评测基准与评测资源

摘要

对于大型语言模型 (LLM) 来说,司法推理的分析仍然具有挑战性。本文提供了一个句子级基准,用于评估大语言模型对解释规范进行分类的能力,正如拉伦茨按照萨维尼的传统所阐述的那样。我们的贡献是三重的。首先,我们将这种解释概念作为分类标准来实施。其次,我们提供了德国联邦宪法法院判决的数据集,并在句子级别进行了注释。第三,我们报告了在专家手写提示下对来自三个模型家族的四名大语言模型的基线评估,并与遗传帕累托(GEPA)优化的提示进行了比较。模型中七个二元子任务的平均 F1 介于 70.4 和 79.2 之间,语法解释通常是最容易识别的规范,而系统解释通常是最难的;在测试的配置下,GEPA 优化的提示并没有系统地优于手写的提示,这表明专家提示提供了有意义的基线。