论文
RARE:高相似语料的冗余感知检索评测
RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora
摘要
现有问答基准通常假设文档彼此不同且重叠较少,但金融报告、法律条文和专利等真实RAG语料具有大量冗余与文档间相似性。评测未考虑冗余时,即使检索到足够证据,也可能低估检索器;标准基准上的强模型也未必能适应高相似语料。我们提出RARE冗余感知检索评测框架,首先将文档分解为原子事实,精确追踪冗余,再用CRRF增强大模型数据生成。CRRF将各项质量标准分开评分,通过排序融合决策,减少生成数据过于简单的问题。我们将RARE应用于金融、法律与专利语料,构建RedQA。强检索基线在四跳General-Wiki上的PerfRecall@10为66.4%,但在RedQA的四跳任务上降至5.0%至27.9%,揭示了当前基准未充分反映的鲁棒性差距。RARE支持构建更贴近领域部署条件的RAG评测。