论文

引文何时会产生误导?法律幻觉检测的声明级基准

When Citations Mislead? A Claim-Level Benchmark for Legal Hallucination Detection

模型评测上下文与知识检索增强基准与评测资源鲁棒性、公平性与可信度评测

摘要

大型语言模型越来越多地用于法律研究和起草,但它们仍然可以在没有引用来源支持的情况下产生听起来令人信服的主张。我们引入了 PARCEL,这是一个用于检查合法索赔是否得到底层机构支持的基准。根据纽约州上诉法院最近的判决,我们构建了一个包含 3,396 个括号式主张的数据集,这些主张被标记为“支持”、“驳斥”或“未找到”。我们将此任务视为一个三向自然语言推理问题,并在零样本设置中评估几个最先进的LLM。尽管最强的模型达到了 0.97 的准确率,但结果也显示出一个重要的弱点:即使提供了完整的意见文本,模型仍然错误地将不受支持的主张标记为支持。在各个模型中,缺少支持比直接矛盾更难检测,而捏造但合理的引用会导致性能下降最大。总体而言,PARCEL 为测试合法 RAG 系统中声明级别的基础性提供了实用的基准。