论文

迷失在对话中还是迷失在翻译中?诊断 RAG 中的多轮退化

Lost in Conversation or Lost in Translation? Diagnosing Multi-Turn Degradation in RAG

模型评测模型能力评测

摘要

在与大语言模型 (LLM) 交谈时,用户通常会从一个简单的问题开始,然后通过后续轮流构建多跳问题。检索增强生成 (RAG) 及其基于图的变体 (GraphRAG) 已成为将 LLM 响应扎根于外部证据的主要方法,但两者几乎都是在单轮、完全指定的查询上进行评估。我们通过大规模模拟研究系统地调查了这种评估不匹配。在之前多轮 LLM 评估工作的基础上,我们将问题从多跳问答 (QA) 基准转换为未指定的对话,并在 150 万个模拟对话中使用 8 个检索系统评估 10 名 LLM 助理。我们的研究结果表明,多轮交互会导致广泛的性能下降,导致相对性能下降高达 21%,不可靠性增加 47%,从而使 RAG 系统的准确性和可靠性同时降低。我们确定了这种退化背后的两种不同的故障模式。系统要么在翻译中丢失,其中对话改写扭曲了检索查询,要么在对话中丢失,其中检索成功但大语言模型无法合成跨回合分布的证据。