论文
如果专家意见不一致,模型就会失败:检测法国法院判决中的隐含法律引用
Where Experts Disagree, Models Fail: Detecting Implicit Legal Citations in French Court Decisions
摘要
将计算方法大规模应用于法律需要将真正的法律推理与表面相似性分开。我们通过一项具体任务来研究这个问题:检测对《法国民法典》的隐含引用,其中法院适用法定规则而不点名:关于法院实际使用的推理的事后问题。我们发布了由三位法律专家注释的 1,015 个段落-文章对的基准。我们的核心发现是,他们的分歧本身就具有丰富的信息:专家争论的第三个案例是模型失败的案例。我们最好的整体 F1 得分为 0.70。然而,其误报的三分之二属于这些有争议的案件,我们评估的所有十个模型都集中如此。分歧是内在困难的信号,而不是注释噪音。然而,这不应该阻止有用的工具:通过多模型共识重新构建为 top-$k$ 排名,相同的信号在没有监督的情况下对于前 200 名候选者达到 76% 的精度。