论文

生成无泄漏基准以进行稳健的 RAG 评估

Generating Leakage-Free Benchmarks for Robust RAG Evaluation

模型评测基准与评测资源

摘要

检索增强生成(RAG)广泛用于用外部知识增强 大语言模型(LLM)。然而,许多旨在测试 RAG 性能的基准数据集包含许多已经可以从 LLM 的参数存储器中回答的问题。这导致评估不可靠。我们将这种现象称为知识泄漏:无需检索即可解决 RAG 任务的情况。由于基准老化,这个问题会随着时间的推移而恶化。随着基准被重复用于训练,它们的内容越来越多地被吸收到模型参数中,从而使得它们评估检索的效率降低。我们引入了 SeedRG,这是一种半合成基准生成管道,可以减少知识泄漏并解决基准老化问题。从种子基准数据集开始,SeedRG 从问题上下文对中提取推理图以捕获其底层推理结构,然后通过类型约束的实体替换生成新的示例。这个过程产生结构相似但新颖的实例,这些实例不太可能存在于模型的参数知识中,同时保留原始推理模式。为了确保质量,我们采用了两个验证步骤:(1)推理图一致性检查以维持任务难度,(2)知识泄漏过滤器以排除无需检索即可回答的实例。