论文

LLM何时会适用错误的法律?诊断大模型在时序法律推理中的失败

When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning

模型评测基准与评测资源

摘要

法律判断预测(LJP)等法律推理任务需要确定在时间上正确版本的、管辖案件的法律——我们将这一能力称为时序适用法确定。然而,大语言模型(LLM)能否可靠地完成这一任务仍无人探究。本文构建了一个基准来评测LLM的时序适用法确定能力,并系统考察它们为何在时序法律推理中失败。实验揭示了四个关键发现:第一,LLM强烈偏向适用最新颁布的法律,而不顾法律相关事实发生于何时;第二,这种偏向既不源于模型不理解法律具有时间效力范围,也不源于对历史法规知识的缺乏;第三,我们提供了行为层面的证据,表明经强化学习塑造的显式推理可能是关键机制:它在提升通用推理能力的同时降低了推理路径的多样性,使模型收敛于适用现行法律;第四,这产生了一个反直觉的反向关系:通用推理能力更强的模型在时序法律推理上往往表现更差。我们的发现为未来改进LLM在时序性法律推理上的表现提供了具体指引。