论文
CrossLex:大语言模型 中跨司法管辖区法律推理的源头扎根基准
CrossLex: A Source-Grounded Benchmark for Cross-Jurisdictional Legal Reasoning in Large Language Models
摘要
法律推理本质上依赖于管辖权:相同的事实可能需要不同的法律规则,并在不同的法律体系中得出不同的结论。然而,现有的基准很少评估 大语言模型 (LLM) 是否能够识别这种司法管辖区特定的差异,特别是当相同的事实模式导致不同的法律结果时。我们引入了 CrossLex,这是一个相同事实、基于法律来源的基准,用于评估 LLM 三个司法管辖区(中国、加利福尼亚和德国)的跨司法管辖区法律推理。 CrossLex 基于权威的法律来源,整合了涵盖合同法、消费者法、刑法、家庭法和劳动法的 55 个法律问题,并构建了与管辖区一致的问题以及答案和支持引文。 CrossLex 总共包含 6,149 个实例,分为 385 个事实组,所有法律问题、答案和引用的权威均经过法律专业人员的审查。为了将基本法律知识与跨辖区推理分开,CrossLex 定义了三个补充任务:单辖区推理(T1)、联合跨辖区比较(T2)和细粒度跨辖区评估(T3)。我们进一步提出了 Grounded Joint,这是一种联合评估答案正确性和合法来源基础的指标,并为简化的基准测试提供统一的评估。对代表性 LLM 的大量实验表明,尽管当前模型通常可以正确回答法律问题,但它们很难提供准确的跨管辖区法律引用。我们希望 CrossLex 能够促进未来基于来源的跨管辖区法律推理的研究。