论文
RAG 基准应该有多细粒度?综合问题生成的分层框架
How Fine-Grained Should a RAG Benchmark Be? A Hierarchical Framework for Synthetic Question Generation
摘要
评估检索增强生成(RAG)系统需要捕捉不同问题特征的基准,但实践者缺乏关于改变哪些维度以及以何种粒度改变的经验指导。我们提出了 HieraRAG,一个用于研究 RAG 基准构建中粒度的分层框架,将最佳粒度定义为在给定 RAG 配置内最大化判别力(跨类别生成质量的标准差)的水平。作为案例研究,我们从 FineWeb-10BT 中生成 3 个维度(问题复杂性、答案类型、语言变异)、3 个粒度级别(2、4 和 8 个类别)的 5,872 个合成问答 (QA) 对。使用 BM25+Falcon-3-10B 管道,最佳粒度因维度而异:复杂性受益于细粒度的区分(判别力:0.053),而答案类型和语言变化在中等粒度时达到峰值。我们引入了一致性比率指标来量化细粒度分割是否干净地细分父类别,从而揭示跨维度的结构差异(问题复杂性:0.40 与答案类型:1.44)。对 110 个分层 QA 对的人工评估证实了合成质量。虽然这些具体发现反映了单一配置,但 HieraRAG 为从业者提供了可移植的过程和验证指标,以确定他们自己的 RAG 设置内的评估粒度。