论文
KlinikeBench:评估诊断准确性之外的语言模型
KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy
摘要
大多数临床基准使用完整的病例描述来评估诊断语言模型 (LM)。然而,在临床实践中,患者以不同的方式呈现信息,临床医生必须获得相关病史并确定需要进行哪些检查才能做出诊断。因此,仅凭诊断准确性并不能确定Agent是否收集了重要信息或进行了适当的临床评估。此外,现有的基准缺乏专业临床医生的验证。为了弥补这一差距,我们引入了 KlinikeBench,这是 333 个临床医生编写的任务的基准,每个任务都提供一个隔离的沙箱环境,其中包含虚拟患者、临床工具和特定于任务的成功标准。超过 35 名临床医生为病例撰写和基准评估做出了贡献。在一项实证研究中,临床医生对模拟对话的平均质量评分高于根据真实对话改编的参考对话。在每项任务中,LM 都有固定的预算轮流与患者沟通、询问相关病史、请求检查、遵循行动限制并记录最终诊断。我们分别和一起对这些步骤进行评分。在 31 个模型和 7 个模型系列中,表现最好的模型(例如 GPT-6-astra 和 Claude Opus 5)在不到 30% 的任务上取得成功,尽管其诊断准确率达到 90.7%。有些模型受益于与患者的交谈;其他人从完整的图表中诊断良好,但在对话中表现较差。总体而言,KlinikeBench 提供了一个用于评估完整临床情况的测试平台,并揭示了交互式临床评估中诊断准确性和性能之间的巨大差距。