论文

LegalCiteBench:评估法律语言模型中的引文可靠性

LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地融入法律起草和研究工作流程,其中不正确的引用或捏造的先例可能会造成严重的职业伤害。现有的法律基准主要强调法定推理、合同理解或一般法律问答,但它们并没有直接研究核心的普通法失败模式:当被要求提供没有外部依据的案例权威时,模型可能会返回看似合理但不正确的引文或案例。我们推出 LegalCiteBench,这是一个研究法律语言模型中的闭卷引文恢复、引文验证和案例匹配的基准。 LegalCiteBench 包含大约 24K 个评估实例,这些实例是根据判例法访问项目的 1,000 条真实的美国司法意见构建的。该基准涵盖五项以引文为中心的任务:引文检索、引文完成、引文错误检测、案例匹配以及案例验证和纠正。在 21 个 LLM 中,在这种封闭的环境中,精确的引文恢复仍然极具挑战性:即使是最强的模型在引文检索和完成方面的得分也低于 7/100。在评估的模型中,规模和法律领域的预训练提供的收益有限,并且不能解决这一困难。根据我们的评估协议,模型还经常提供具体但不正确或低重叠的权威,在检索繁重任务的 21 个评估模型中,有 20 个模型的误导性答案率 (MAR) 超过 94%。仅提示弃权实验表明,明确的不确定性指令会减少一些可信的捏造行为,但不会提高引用的正确性。 LegalCiteBench 旨在作为一个诊断框架,用于研究外部外部依据关联缺失、不完整或被绕过时的权威生成失败、验证行为和弃权行为。