论文

检索增强生成中的灵敏度、鲁棒性和稳定性的系统级分析

A Systems-Level Analysis of Sensitivity, Robustness, and Stability in Retrieval-Augmented Generation

模型评测评测方法与指标

摘要

检索增强生成 (RAG) 系统通常使用最终答案准确性进行评估,即使它们的失败可能源于预处理、检索、上下文打包或生成。本文提出了一项针对 56 次实验运行的 RAG 灵敏度、鲁棒性和稳定性的受控实证研究。我们评估块大小、检索深度(前 k)、基于嵌入的重新排序、概率检索噪声和重复种子运行如何影响检索、上下文打包和生成行为。使用映射到 20,958 个独特语料库上下文的固定 500 个问题 QA 子集,我们分析最终答案指标和中间故障模式。在这些实验中,面向检索的指标在更广泛的检索设置下得到了改善,而下游精确匹配和 F1 分数通常表现得非单调。我们还观察到在较小的块大小下预处理引起的答案丢失、检索损坏下的渐进退化以及在更广泛的检索机制中观察到的更高的方差。这些发现表明,RAG 评估应包括敏感性、鲁棒性、稳定性和多阶段故障分析,而不是仅仅依赖于最终答案的准确性。