论文

当评分标准失效时:幻觉暴露了医疗AI评估中的盲区

When Rubrics Fail: Hallucinations Reveal Blind Spots in Medical AI Evaluation

模型评测评测方法与指标

摘要

幻觉可能削弱临床医生对大语言模型(LLM)的信任,因此评估方法需能捕捉到临床相关的错误。基于评分标准的评估已成为医疗领域评估LLM的主流方法,但尚不清楚这些评分是否能反映此类错误。我们首先在受控环境中使用MedHallu进行研究,发现更具体的评分标准能更好地区分正确与幻觉响应。为系统性验证,我们构建了医疗幻觉类型的分类体系,并开发了一条由临床专家验证的错误注入流程,可生成匹配的正确与错误注入响应。在HealthBench、HealthBench Professional和LiveMedBench三个基准上,我们发现现有评分标准常遗漏具有临床相关性的幻觉,且多数情况下评分保持不变。研究发现,评分标准在明确检查事实时效果最佳,而在面对额外或意外的错误时,其有效性显著下降。初步的基于检索的事实性检查能够恢复部分被评分标准忽略的错误,表明可作为一种互补方案。这些发现揭示了当前医疗领域LLM评估中的系统性盲区,表明仅依赖评分标准无法确立临床可靠性,可能削弱临床医生对模型的信任与信心。

当评分标准失效时:幻觉暴露了医疗AI评估中的盲区:论文配图
图 1:基于量规的评估中的盲点。带有安全指导的答案与危险的百倍剂量幻觉形成鲜明对比。两种反应均使用相同的评分标准和LLM评分器进行评估,尽管存在临床严重错误,但仍获得无法区分的分数。