论文
相同的问题,不同的来源,不同的答案:审计医疗多源 RAG 中的源依赖性
Same Question, Different Source, Different Answer: Auditing Source-Dependence in Medical Multi-Source RAG
摘要
部署在多作者机构语料库上的检索增强生成(RAG)系统可以根据检索的来源对同一问题给出不同的答案——这是主导单一黄金答案范式无法诊断的失败模式。我们认为,来源依赖是 NLP 评估中缺失的一个轴,对其进行审核意味着将评估单位从答案正确性转变为来源间关系。我们在移植患者教育中具体化了这一点,机构来源显然不同意,发布了三个制品:TransplantQA,真实患者问题的基准,每个问题的答案都是通过多个机构手册作为候选来源的基础一代来回答的; HERO-QA,一种分层检索策略,可对每个答案进行基础和审核;以及一个结构化输出法官,根据经过验证的 5 标签分类法对源间关系进行评分。从规模上看,更好的检索揭示出的分歧比之前的估计要多得多——低估了其普遍性,而不是其强度。该框架与领域无关,并转移到法律和教育 RAG:测量源依赖性通常是部署的多源 NLP 的责任。