论文

RAG-DIVE:检索增强生成中多轮对话评估的动态方法

RAG-DIVE: A Dynamic Approach for Multi-Turn Dialogue Evaluation in Retrieval-Augmented Generation

模型评测评测方法与指标

摘要

使用静态多轮数据集评估检索增强生成(RAG)系统无法捕捉现实世界对话的动态本质。现有的评估方法依赖于预定义的数据集,这将它们限制为静态、单向查询,并限制了它们在交互式、多轮设置中捕获 RAG 系统的自适应、上下文相关性能的能力。因此,我们引入了 RAG-DIVE,一种动态交互式验证和评估方法,可模拟用户与 RAG 系统的交互。 RAG-DIVE 利用 LLM 动态生成多轮对话,并分为三个组件。对话生成阶段由(1)对话生成器和(2)对话验证器组成,对话生成器通过创建多轮查询来模拟用户,对话验证器过滤并纠正无效或低质量的输出以确保连贯的对话。评估阶段由 (3) 对话评估器处理,该评估器评估 RAG 系统在整个对话中的性能,并生成每轮和多轮指标,以提供系统行为的聚合视图。我们通过两个实验设置验证了 RAG-DIVE。首先,我们测试了一个示例 RAG 系统,包括对对话质量的人工评估、评估一致性的重复试验以及显示 RAG-DIVE 检测到系统修改引起的性能变化的消融研究。其次,我们将 RAG-DIVE 与工业 RAG 系统在不同配置下的传统静态数据集评估进行比较,以验证两种方法是否揭示了相似的性能趋势。我们的研究结果表明,RAG-DIVE 有助于对多轮对话进行动态、交互驱动的评估,从而推进 RAG 系统的评估。