论文

大语言模型 的临床计算能力有多强大?临床环境中数字推理能力的实证研究

How Robust Are Large Language Models for Clinical Numeracy? An Empirical Study on Numerical Reasoning Abilities in Clinical Contexts

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地被探索用于临床问答和决策支持,但安全部署关键需要可靠地处理异构临床记录中的患者测量结果。用于临床数值推理的 LLM 的现有评估提供了有限的操作级别覆盖范围,主要限于算术计算,并且很少评估跨临床记录格式的数值理解的稳健性。我们引入了 ClinicNumRobBench,这是一个包含 1,624 个上下文问题实例和 真值 答案的基准,可评估四种主要类型的临床计算能力:值检索、算术计算、关系比较和聚合。为了对稳健性进行压力测试,ClinicNumRobBench 以三种语义等效的表示形式呈现纵向 MIMIC-IV 生命体征记录,包括源自开放患者数据集的真实世界笔记样式变体,并使用 42 个问题模板实例化查询。在 17 LLM 上进行的实验表明,值检索总体较强,大多数模型的准确率超过 85%,而关系比较和聚合仍然具有挑战性,部分模型的准确率低于 15%。相对于基本模型,微调 在医疗数据上的计算能力可以降低 30% 以上,并且笔记样式变化下的性能下降表明 LLM 对格式的敏感性。 ClinicNumRobBench 为临床可靠的数字推理提供了严格的测试平台。代码和数据 URL 可在 https://github.com/MinhVuong2000/ClinicNumRobBench 上获取。