论文

教学知识还是临床病例?数据类型如何塑造医疗大语言模型

Didactic knowledge or Clinical Cases? How Data Types Shape Medical Large Language Models

模型评测模型行为与机制分析

摘要

医疗大语言模型通常在教学数据(如教科书)与临床数据(如患者记录)的混合上训练,但这些数据类型如何差异化地塑造模型能力仍不清楚。我们通过token量匹配的实验解决这一问题:改变教学与临床数据配比,分析数据构成如何影响知识密集型与临床导向任务上的性能、能力画像与错误模式。我们发现跨任务类型的不对称迁移:临床数据改善临床导向任务,同时在知识密集型任务上保持竞争力;而教学数据主要改善知识密集型任务。错误分析提示知行差距——知识记忆的提升并不能可靠地泛化到临床推理。我们进一步观察到,少量临床数据即可在基于EHR的任务上取得大部分收益,而最优配比随下游任务的知识与临床推理需求而变化。这些发现表明,医疗LLM的数据策展应以应用为导向,对推理密集型用例应偏好更高比例的临床数据。

教学知识还是临床病例?数据类型如何塑造医疗大语言模型:论文配图
图 1:教学性与临床病例数据在两种问答格式下的示例。