论文
没有临床注意的临床医生级协议:LLM 医疗 AI 基准测试中的评估者限制
Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking
摘要
开放式响应评估提供了比多项选择基准更强的临床有效性,但会产生评分瓶颈,从而激发自动化 LLM-asa-Judge 方法。然而,此类评估人员是否能够复制临床校准和谨慎态度,仍有待检验。我们推出了 MedQADE,这是德语的第一个标准化开放式反应临床基准,德语是一种缺乏本地评估基础设施的主要临床语言,包含由 10 名执业医师和 9 名 大语言模型 (LLM) 评估员注释的 3,800 个项目。表现最好的评估器模型 Gemini 3 Flash 达到了与医生上限一致的一致性(\k{appa} = 0.694 与 \k{appa} = 0.709),尽管宽置信区间限制了解释。尽管存在这种统计一致性,自动评估者却表现出几乎不存在的临床元认知:医生根据项目难度来衡量放弃程度,而前沿模型在每个案例中都给出了明确的分数。我们还量化了系统的谱系依赖性偏差,其中模型优先对建筑兄弟进行评分,这是一种与语言无关的效应。这些结果表明,统计一致性并不能确保临床谨慎,并且评估者的独立性需要明确的验证。