论文

超越基准分数:RAG 评估中综合查询分布和真实查询分布有何不同

Beyond Benchmark Scores: How Synthetic and Authentic Query Distributions Diverge in RAG Evaluation

模型评测评测方法与指标

摘要

RAG 系统通常使用从目标文档语料库生成的合成问题集进行评估。虽然这种做法对整体检索能力提供了有用的检查,但完全依赖综合基准可能会误导分布转移并夸大部署准备情况。综合生成将问题均匀地分布在整个语料库中,形成长而详细的查询;真实用户将大部分流量放在简短查询中的一些管理和程序主题上,同时还会询问生成器根本未涵盖的问题。我们在大学教师信息系统上展示了这一差距,将通过 Gemini Notebook 生成的 1,851 个综合问题与通过学生调查收集的 322 个真实查询进行比较。合成查询集和真实查询集存在显着差异:真实查询平均包含 6.8 个单词,而合成查询平均为 15.7 个单词,并且仅从 53 个独特源中提取数据,而合成查询集则为 165 个。因此,在合成基准测试中显得非常有效的配置在真实查询中会出现性能大幅下降。重要的是,对综合查询进行优化选择了更高延迟的混合检索器。在我们的设置中,稀疏检索组件有利于较长的综合问题,但不适用于较短的真实问题,其成本高达我们测试的最快配置的 8 倍延迟。我们建议将合成查询集和真实查询集视为查询质量范围的互补极端:合成数据验证理想条件下的最大检索能力,而真实查询则测试系统对真实用户的不精确、未指定输入的鲁棒性。