论文
医学长答案的检索后核验为何失败:自动错误分类
Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification
摘要
基于检索的事实性评估,即大语言模型生成的主张根据权威医学语料库的证据进行验证,已成为高风险临床环境中可扩展幻觉检测的主导范例。尽管可靠和透明的医疗事实验证非常紧迫,但大多数系统都使用 F1 等聚合指标来衡量性能,这掩盖了故障发生的位置和原因。现有的 RAG 诊断需要黄金答案或带注释的黄金证据,而这两者在该制度中都不存在。我们引入了两种综合分类法,基于开放式 MedExpert 数据集和 3 个封闭式数据集的案例研究,将失败分解为沿五个质量维度的检索阶段错误,并将验证者推理错误分解为六个连续步骤。我们使用 LLM-as-Judge 调整自动模式归纳管道来标记证据质量并对验证者推理错误进行大规模分类,然后对 4 种检索方法和 6 种前沿验证者模型的结果进行压力测试。我们的分析表明,缩放模型大小、增加推理工作、扩展到权威网络资源以及应用医疗微调并不能解决这些故障模式,这表明它们代表了开放式医疗环境中检索然后验证范式的基本局限性,而不是过时系统的产物。我们在 https://anonymous.4open.science/r/Medical_RAG_eval-4AB5 上发布了我们的代码和数据,以保证我们结果的完全可重复性。
