论文
法律 RAG 中的时间误解:法国税法的版本化语料库基准
Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law
摘要
我们识别并量化时间误解:当适用的版本是早期或未来的版本时,系统地检索和引用法律文章的当前有效版本。标准合法的 RAG 将语料库视为静态的;我们认为法律问答是一个时间索引的检索问题。我们推出 FiscalQA Pro,将法国税法(93 年,1938-2031)的 32,436 篇文章版本的版本语料库与全模型硬时间推理轨道配对:33 篇 CGI 文章中的 209 个评分、专家评审问题(221 篇已发布;12 篇被标记为超出可回答范围)。在选择时,没有评估模型在四次抽样抽取中的任何一次中恢复其适用于日期的闭卷答案,并且当前有效的文本缺乏除了一个评分问题之外的所有问题的标准答案。答案是通过原子 真值“块”(正则表达式和带有容差的数字)确定性地评分,而不是 LLM 作为法官:LLM 法官将继承其旨在评分的时间偏差。在 11 个模型中(5 个前沿封闭 API 系统加上 Gemini 2.5 Pro 作为替代项,以及 5 个开放权重),参数化知识的平均严格准确度为 3.0%,RAG 相对于静态当前版本语料库为 2.7%。静态 RAG 在 0% 的时间内检索适用日期的版本,自信地引用真实但不适用的版本。我们的端到端 检索器 在多版本索引上,没有预言机,达到 98.3% 意味着严格;预言机文章消融达到 99.1%,将剩余差距定位在第一阶段召回中,而不是版本选择中。我们还发布了包含 69,208 个引文链接的版本感知法理学数据集,以及语料库、基准、模型响应和管道代码。