论文

BenGER:德国法律中基于包含的法律推理的 LLM 系统基准测试

BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

模型评测基准与评测资源

摘要

我们介绍 BenGER(德国法律基准),这是一个基准和数据集,用于评估德国法律中基于包含的法律推理的 LLM 系统。该数据集结合了跨多个法律教育级别的 596 个考试式自由文本法律案例任务和 531 个简短的理论推理任务。它包括在无人辅助和人类与人工智能共同创建条件下定时人类编写的解决方案的受控验证子集。我们评估了 12 个当代 LLM 系统 - 封闭旗舰、以效率为导向、开放权重 - 使用符合标准的 LLM-as-a-Judge 与多评估者人工评分层进行交叉验证(每个解决方案进行 3 次盲审,以人类池为基准的 6 个法官家庭)。封闭旗舰系统在所有三个语料库中均处于领先地位,人类与人工智能的共同创造显着改善了无人辅助的人类工作,LLM 评委以 Pearson r=0.76 和 Cohen k=0.60 跟踪人类评分。各个法官家族的系统排名都很稳定,来自独立提供商的两名法官清除了人工撰写解决方案的卡尔德隆单一审稿人替换标准。