论文
覆盖范围,而不是平均值:可信检索评估的语义分层
Coverage, Not Averages: Semantic Stratification for Trustworthy Retrieval Evaluation
摘要
检索质量是检索增强生成(RAG)准确性和鲁棒性的主要瓶颈。当前的评估依赖于启发式构造的查询集,这引入了隐藏的内在偏差。我们将检索评估形式化为统计估计问题,表明度量可靠性从根本上受到评估集构造的限制。我们进一步引入\emph{语义分层},它通过将文档组织到基于实体的集群的可解释的全局空间中并系统地生成缺失层的查询来对语料库结构进行评估。这产生了(1)跨检索机制的正式语义覆盖保证和(2)检索失败模式的可解释可见性。跨多个基准和检索方法的实验验证了我们的框架。结果揭示了系统的覆盖范围差距,识别了解释检索性能差异的结构信号,并表明分层评估可以产生更稳定和透明的评估,同时支持比聚合指标更值得信赖的决策。