论文

CanLegalRAGBench:根据加拿大判例法评估检索增强生成

CanLegalRAGBench: Evaluating Retrieval-Augmented Generation on Canadian Case Law

模型评测基准与评测资源

摘要

基于 RAG 的法律助理越来越受欢迎,但 LLM 幻觉仍然是一个关键问题,并可能损害正义。虽然已经开发了基准来评估进展,但许多基准依赖于综合查询而不是现实的法律场景。此外,加拿大法律在现有评估中的代表性仍然不足。为了解决这一差距,我们引入了 CanLegalRAGBench,这是一个加拿大法律 QA 基准,基于基于判例法的现实查询和专家注释答案。我们的评估表明,检索性能对设计选择很敏感,并且开源嵌入模型与闭源模型具有竞争力。然而,它也揭示了自动评估的局限性,自动评估会惩罚检索替代相关文档的系统。我们还发现,生成的答案通常与黄金响应不同,要么是产生幻觉,要么是产生过于详细或不相关的内容,8-29% 的主张没有得到检索到的文档的支持。我们希望这个基准将有助于推动在解决合法 RAG 系统的局限性方面取得持续进展。