论文
测试具有块覆盖的检索增强生成系统
Testing Retrieval-Augmented Generation Systems with Chunk Coverage
摘要
基于检索增强生成(RAG)的系统\脚注{为了简洁起见,基于 RAG 的系统在本文中被称为 RAG 系统。}越来越多地部署在高风险环境中,其中正确的行为不仅取决于语言模型,还取决于在推理时选择外部文档的检索组件。虽然现有的 RAG 评估指标在每个查询的基础上评估检索和生成质量,通常依赖于查询级测试预言(例如参考答案或相关性注释),但它们对测试套件是否充分执行整个系统的检索行为提供的了解有限。在本文中,我们介绍了块覆盖率(CC),这是一种独立于预言机的测试充分性标准,用于测试 RAG 系统的检索组件。 CC 测量在整个测试套件中至少检索一次的语料库块的比例,提供检索空间的哪些部分已被使用的结构视图。我们进一步展示了如何使用 CC 通过优先查询扩大先前未执行的检索区域的覆盖范围来指导测试选择和生成。我们在临床和财务 RAG 系统场景中评估 CC。 CC 引导的测试达到可达到的覆盖率的 50%,比随机选择快 1.7 倍,比冗余偏向策略快 4.2 倍。此外,CC 比随机错误检测有效性 (APFD) 提高了 10% 到 25%,这表明可以更早地发现不同的检索错误。这些结果表明,CC 无需测试预言机即可捕获与有效测试相关的检索多样性。