论文
ClinDet-Bench:超越弃权,评估 LLM 在临床决策中的判断可定性
ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making
摘要
临床决策常需在不完整信息下做出。临床专家必须判断已有信息是否足以做出判断,因为过早下结论与不必要的弃权都会危及患者安全。为评估大语言模型(LLM)的这一能力,我们开发了 ClinDet-Bench,一个基于临床评分系统的基准,将不完整信息场景分解为可判定与不可判定两种条件。识别可定性需要考虑关于缺失信息的所有假设——包括不太可能的假设——并核实结论在所有假设下是否成立。我们发现,尽管近期 LLM 能正确解释底层评分知识并在完整信息下表现良好,它们仍无法在不完整信息下识别可定性,既产生过早判断,也产生过度弃权。这些发现表明,现有基准不足以评估 LLM 在临床场景中的安全性。ClinDet-Bench 提供了评估可定性识别、进而实现恰当弃权的框架,有望应用于医学及其他高风险领域,并已公开发布。
