论文

RAGStress:用于评估知识库退化下检索增强生成的受控基准

RAGStress: A controlled benchmark for evaluating retrieval-augmented generation under knowledge-base degradation

模型评测基准与评测资源

摘要

检索增强生成 (RAG) 通常是在底层知识库 (KB) 干净的隐含假设下进行评估的,从而使 RAG 系统在实际 KB 退化下的行为难以表征。我们引入了 RAGStress,这是一种受控评估基准,用于在系统性 KB 损坏情况下对 RAG 系统进行压力测试。该基准测试通过基于 57 个 MMLU 主题和 182,546 个文档构建的单 KB 元数据过滤实验设计,将四种自然损坏类型(事实损坏、数字拼写错误、相关性中毒和矛盾注入)与三个严重级别(微妙、中等和明显)配对。在 52,500 个模型-问题-条件评估中,RAGStress 揭示了干净的检索可以掩盖鲁棒性差异,语义保真度损坏比信号效用扰动危害更大,无检索精度不能预测损坏检索的鲁棒性,并且混合 KB 精度不应被视为最坏情况下的鲁棒性。我们记录了基准测试的预期用途、支持的声明和限制,并提供了一个工件包,包括生成脚本、损坏提示、元数据模式和评估代码。 RAGStress 旨在作为 KB 损坏情况下 RAG 稳健性的受控压力测试,而不是作为通用模型排行榜。

RAGStress:用于评估知识库退化下检索增强生成的受控基准的原论文方法或结果图
图 3:Wilson 95% CI 在四种损坏类型、三种严重性级别和五种模型(每个单元 $n=700$)中的准确度 (%)。行分为语义保真度(事实损坏、矛盾)和信号效用(数字拼写错误、相关性中毒)损坏。色标以 50% 为中心:红色表示高脆弱性,蓝色表示稳健性。注释条显示 CI 的干净检索和无检索基线。完整的 CI 值见表 1。