论文

LexKairos:LLM 中法律时间功能的基准测试

LexKairos: Benchmarking Legal Temporal Capabilities in LLMs

模型评测基准与评测资源

摘要

大语言模型 (LLM) 在广泛的法律任务中表现出了强大的性能。在法律实践中,时间是一个关键概念,它支配着法规的有效性、法律案件的进展以及程序期限的执行。然而,在现有的法律人工智能基准中,法律时间能力仍未得到充分探索。为了解决这一差距,我们提出了 LexKairos,这是一个综合基准,用于评估 LLM 在中国法律背景下的时间能力,涵盖三个维度:法定时间知识、案件时间模型和法规案件时间推理。 LexKairos 包含来自现实世界的中国司法案例和法规的九个子任务。我们在多种推理设置下对八个 LLM 进行了系统评估,包括普通、思维链 (CoT) 和思维模式。我们的结果表明,Gemini-3-Flash 实现了最强的整体性能,但即使是性能最好的模型,在需要精确时间敏感的法定元数据调用或时间限制内的复杂推理的任务上也表现出显着的局限性,这表明法律时态知识和推理仍然是当前 LLM 面临的挑战。数据和代码可在 https://github.com/thunlp/LexKairos 获取。