论文
StratRAG:用于检索增强生成系统的多跳检索评估数据集
StratRAG: A Multi-Hop Retrieval Evaluation Dataset for Retrieval-Augmented Generation Systems
摘要
我们引入了 StratRAG,这是一个开源检索评估数据集,用于在现实、嘈杂的文档池条件下对多跳推理任务的检索增强生成 (RAG) 系统进行基准测试。 StratRAG 源自 HotpotQA(干扰项设置),包含 2,200 个示例,涵盖三种问题类型(桥梁、比较和是/否),每个示例都与 15 个候选文档池配对,其中恰好包含 2 个标准相关文档和 13 个主题相关的干扰项。我们对三种检索策略进行基准测试——BM25、密集检索(all-MiniLM-L6-v2)和混合融合——在验证集上报告 Recall@k、MRR 和 NDCG@5。混合检索实现了最佳的整体性能(Recall@2 = 0.70,MRR = 0.93),但桥梁问题仍然要困难得多(Recall@2 = 0.67),这激励了未来基于强化学习的检索策略的工作。 StratRAG 可在 https://huggingface.co/datasets/Aryanp088/StratRAG 上公开获取。