论文

评估干净、误导和混合检索下的 RAG 可靠性

Evaluating RAG Reliability under Clean, Misleading, and Mixed Retrieval

模型评测评测方法与指标

摘要

检索增强生成 (RAG) 被广泛用于通过将答案建立在检索到的证据中来提高 大语言模型 (LLM) 的事实可靠性。然而,在错误信息丰富的环境中,检索到的内容可能包括看似合理但不正确的信息,引发人们对基于 RAG 的信息访问系统的可靠性的担忧。在这项工作中,我们提出了一种评估协议,系统地测试 RAG 系统如何处理参数知识与从具有不同数量的误导性信息的上下文中检索到的证据之间的冲突。我们的目标是模型能够正确响应的事实问题的正确答案,即使没有检索,并用它来用干净的、有毒的和混合的证据来测试系统。所提出的分析框架结合了参数覆盖和置信度指标来评估误导性信息何时以及如何影响 LLM 的生成过程。本研究旨在深入了解 RAG 系统在信息混乱场景中的鲁棒性。