论文

评估表格数据基础模型的比较框架:医疗保健案例研究

A Comparative Framework for Evaluating Foundation Models on Tabular Data: A Case Study in Healthcare

模型评测评测方法与指标

摘要

表格数据是临床实践中最常见的格式,包括实验室结果、用药记录、诊断代码和患者人口统计数据。随着表格数据的基础模型的数量和种类不断增加,一个实际问题变得更难回答:临床医生或数据科学家应该为给定任务实际选择哪种模型,为什么?现有的调查对这些模型的功能进行了分类,但它们没有提供一种结构化的方法来将它们与实际应用程序的特定需求进行比较。我们引入了 \system{},一个比较评估框架,它可以在六个有临床意义的维度上对表格基础模型(TFM)进行评分和排名:模型对新数据集的推广效果如何,它如何有效地保护患者隐私,它需要多少数据才能表现良好,它如何随着数据集和特征空间的增长而扩展,它的预测对临床医生来说如何解释,以及它在患者亚组中的表现如何公平。每个维度都被分解为可测量的子组件,子组件组可以选择性地组合成补充复合分数,称为超级指标,它提供了模型如何同时在多个维度上执行的诊断视图。为了展示该框架在实践中的工作原理,我们将其应用于两个医疗保健用例,筛查缺铁和预测心力衰竭,展示同一组指标如何根据每个临床环境中最重要的因素导致不同的模型排名。我们还提供了按底层架构组织的 45 个 TFM 的分类法,为希望驾驭这个快速扩展的领域的研究人员和从业者提供参考。