论文

ClinDet-Bench:超越弃权,评估 LLM 在临床决策中的判断可定性

ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making

模型评测基准与评测资源

摘要

临床决策常需在不完整信息下做出。临床专家必须判断已有信息是否足以做出判断,因为过早下结论与不必要的弃权都会危及患者安全。为评估大语言模型(LLM)的这一能力,我们开发了 ClinDet-Bench,一个基于临床评分系统的基准,将不完整信息场景分解为可判定与不可判定两种条件。识别可定性需要考虑关于缺失信息的所有假设——包括不太可能的假设——并核实结论在所有假设下是否成立。我们发现,尽管近期 LLM 能正确解释底层评分知识并在完整信息下表现良好,它们仍无法在不完整信息下识别可定性,既产生过早判断,也产生过度弃权。这些发现表明,现有基准不足以评估 LLM 在临床场景中的安全性。ClinDet-Bench 提供了评估可定性识别、进而实现恰当弃权的框架,有望应用于医学及其他高风险领域,并已公开发布。

ClinDet-Bench:超越弃权,评估 LLM 在临床决策中的判断可定性
图1:ClinDet-Bench 概览。左侧面板展示两个任务:测试评分系统知识的解释任务(Explanation Task),以及测试在不同信息条件下判断能力的临床决策任务(Clinical Decision Task)。右侧面板展示临床决策任务的三种信息条件,依据可能的分数范围是否跨越决策阈值来划分;若跨越,则无法确定 ground truth。