论文

多重法律基准:当答案在输入中时。法院登记处建立的法律基准中的标签泄露

Multi-Legal-Bench: When the Answer Is in the Input. Label Leakage in Legal Benchmarks Built from Court Registries

模型评测基准与评测资源

摘要

法院登记处发布了数以百万计的带有结构化元数据的判决,这使它们成为带有标签的法律基准的有吸引力的来源:法院类型、判决的形式及其主题领域都是免费的。我们表明,这种便利性的代价是注册表衍生的基准很少衡量的。我们建立了多重法律基准,它评估五个国家登记处(法国、荷兰、波兰、捷克共和国和立陶宛)对本地法院判决的相同任务,扩展了乌克兰 UA 法律基准,并审核其单元实际测量的内容。不使用模型的关键字扫描在荷兰判决形式分类上达到 96%(相对于 50% 多数基线),在法国法院类型分类上达到 84%(相对于 33%),在波兰判决形式分类上达到 66%,其中所有九个模型最多增加 7 个点。用掩码替换输入中的标签名称可以使扫描到所有六个受影响的单元中的多数层,并且九个模型中的八个在大多数模型中(54 个模型单元对中的 39 个)显着失去准确性,高达 48 点(荷兰判断形式:100% 到 52%);只有克劳德十四行诗 5 基本上不受影响。配对 McNemar 测试与 Holm 校正发现一个领导者仅在 12 个单元中的两个(每个单元都有不同的模型)中击败了所有其他模型;但是一旦标签名称被屏蔽,同一个模型就会领先这两个模型,并且模型之间的差距在每个屏蔽单元中都会扩大。模型之间表面上的相似性部分是由泄漏本身产生的。审计还暴露了我们早期版本中的评分缺陷(用变音符号书写的答案被评分为错误,低估了捷克语判断形式的准确性高达 90 分),我们对此进行了更正并记录。我们建议从法院登记处建立的每个基准都报告无模型基线和每个单元的屏蔽控制。所有数据、提示、预测和评分代码均已发布。