论文
通过 TRIAD 自动执行多跳 RAG 评估:从上下文提取到验证数据集生成
Automating Multi-Hop RAG Evaluation via TRIAD: From Context Extraction to Validated Dataset Generation
摘要
LLM 的最新进展以及 RAG 系统在行业中的采用产生了对特定领域问答数据集的需求,这些数据集可以评估专有数据上的 RAG 性能。现有数据集(例如 HotpotQA)对基于维基百科知识的当前 RAG 系统提出了挑战,但它们无法直接转移到特定于领域的设置。对RAG系统质量的全面评估既需要多跳查询,也需要无解的问题。本文介绍了 TRIAD,一种三阶段自动数据集生成方法。首先,它为 RAG 系统的特定领域知识库生成问答 (QA) 对。其次,验证器检查反馈循环中的每个 QA 对。第三,使用相关性标记的上下文文档来扩展 QA 对,以进行下游评估。我们根据已建立的 MuSiQue 和 HotpotQA 数据集评估这种方法。结果表明,生成的数据集在不同的 RAG 设置中表现出相似的性能趋势,而人工验证表明这些问题适合评估特定领域的 RAG 系统。用于生成数据集的代码和所有验证结果都可以在我们的 GitHub 存储库 (https://github.com/lorenzbrehme/triad) 中找到。