论文

CLExEval:用于 LLM 临床推理定性评估的人机循环框架

CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

模型评测评测方法与指标

摘要

大语言模型 (LLM) 在许多医学基准上取得了强劲的结果,但其临床推理仍然难以可靠评估。一个主要风险是评估错觉:即使最终诊断不正确,流畅且结构良好的解释在临床上也可能令人信服。我们引入了 CLExEval,这是一个人机交互框架,用于在渐进式信息屏蔽下评估 LLM 临床推理。 CLExEval 结合了 5,600 个专家医生注释和源自 40 个罕见诊断病例的 200 个临床推理轨迹。我们的分析确定了三种反复出现的故障模式:(i) 冗长偏差,在信息稀缺的情况下,GPT-4o-mini 的诊断准确性从 95.0% 下降到 32.5%; (ii) 隐藏知识悖论,其中专业模型达到 92.5% 的最大诊断潜力,但无法在详细上下文中可靠地检索该知识; (iii) 68.6% 的推理与输出不匹配,其中正确的诊断出现在推理轨迹中,但没有反映在最终答案中。我们进一步在人类验证的失败集(n = 142)上评估 LLM-as-a-Judge 范式。 GPT-4o-mini 批准了 47.9% 的临床错误输出,而 HuatuoGPT-o1 批准了所有有效评分的失败,并显示出积极的自我偏好偏差。这些结果表明,在没有专家验证的情况下,独立的自动化临床评估可能会大大高估临床可靠性。