论文
细粒度索赔级 RAG 法律基准
Fine-grained Claim-level RAG Benchmark for Law
摘要
大语言模型 (LLM) 的快速进展正在将语义搜索转向问答范式,即用户提出问题,LLM 生成响应。在法律等高风险领域,检索增强生成(RAG)通常用于减轻生成响应中的幻觉。尽管如此,之前的工作表明,RAG 系统,无论是通用的还是特定于法律的,仍然以不同的速度产生幻觉,因此细粒度的评估至关重要。尽管有必要,但现有的合法 RAG 系统评估框架缺乏分别提供检索和生成性能详细分析所需的粒度。此外,当前的基准测试主要是英文的,并且以法律专家的查询为中心,忽视了非专家的需求。我们推出了 ClaimRAG-LAW,这是一个法律 RAG 的综合数据集,支持法语和英语,针对专家和非专家,并包括反映现实场景的多种问题类型。我们进一步应用了最先进的法律 RAG 系统的细粒度评估框架,揭示了法律领域检索、生成和权利要求级别分析的局限性。