论文
RAG-TESTER:检索增强LLM的自动端到端测试
RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models
摘要
增强检索生成(RAG)使大语言模型(LLMs)能够利用外部和领域特定的知识,但其可靠性依赖于生成模型、嵌入模型、检索机制和提示构造策略之间的交互。我们提出 RagTester,这是一种用于 RAG 系统的自动化端到端测试方法。RagTester 生成检索文档、测试输入和预期输出;执行测试;并使用 LLM 作为判分器来评估结果。其测试生成策略针对复杂段落、不支持的查询和文档覆盖标准。我们使用八种 LLMs 和六种嵌入模型进行评估,产生 24 个兼容配置,并将其与基准测试输入生成器进行比较。在 72,000 次测试执行中,RagTester 发现了 21,633 个失败,比基准测试高出 6.6%,并在24个配置中的20个优于基线。检测到的失败包括不准确的检索、不支持的答案、未使用检索到的上下文,以及难以解释复杂段落。这些结果表明,覆盖导向的测试生成可以有效地暴露由检索和生成组件之间的交互引起的失败,并支持在部署前评估 RAG 配置。
