论文
当评分标准失效时:幻觉暴露了医疗AI评估中的盲区
When Rubrics Fail: Hallucinations Reveal Blind Spots in Medical AI Evaluation
摘要
幻觉可能削弱临床医生对大语言模型(LLM)的信任,因此评估方法需能捕捉到临床相关的错误。基于评分标准的评估已成为医疗领域评估LLM的主流方法,但尚不清楚这些评分是否能反映此类错误。我们首先在受控环境中使用MedHallu进行研究,发现更具体的评分标准能更好地区分正确与幻觉响应。为系统性验证,我们构建了医疗幻觉类型的分类体系,并开发了一条由临床专家验证的错误注入流程,可生成匹配的正确与错误注入响应。在HealthBench、HealthBench Professional和LiveMedBench三个基准上,我们发现现有评分标准常遗漏具有临床相关性的幻觉,且多数情况下评分保持不变。研究发现,评分标准在明确检查事实时效果最佳,而在面对额外或意外的错误时,其有效性显著下降。初步的基于检索的事实性检查能够恢复部分被评分标准忽略的错误,表明可作为一种互补方案。这些发现揭示了当前医疗领域LLM评估中的系统性盲区,表明仅依赖评分标准无法确立临床可靠性,可能削弱临床医生对模型的信任与信心。
