论文

为什么 RAG 产生幻觉:具有知识缺口金丝雀的检索增强生成系统的惩罚意识评估

Why RAGs Hallucinate: Penalty-Aware Evaluation of Retrieval-Augmented Generation Systems with Knowledge-Gap Canaries

模型评测评测方法与指标

摘要

基于容量的准确性奖励检索增强生成(RAG)系统的猜测:一个能够回答所有问题的系统的得分超过了一个在其知识库无法支持答案时下降的系统。基于 Kalai 等人的置信目标分析。 (2025),我们为部署的 RAG 产品提出了一个惩罚感知评估框架,结合了 (i) 不对称评分(正确 +1,错误 -4,弃权 0),(ii) 知识差距金丝雀,其答案可验证地不存在于知识库中的问题,因此任何答案都构成参数记忆的无根据生成,以及 (iii) 一个将检索、生成和弃权策略失败分开的失败归因管道。将该框架应用于三个商业 RAG 系统和 SimpleQA-Verified 上的无检索基线(1,000 个问题 x 3 次重复,由跨家庭三名评审小组以 98.9% 的一致性进行盲评分),我们发现回答时的准确性在不同系统中紧密聚集 (97.0-98.0%),而金丝雀违规率大约相差六倍(16.7% 与 98.1%)。系统之间的区别与其说是它们正确回答的内容,不如说是它们是否在不应该回答的情况下回答的问题,并且惩罚感知评分会相应地重新排序基于数量的排名;从 k=1 到 k=9 的惩罚设置中,重新排序是稳定的。所有代码、配置、成绩单和评委投票均已发布以供独立审核。