论文

超越准确率看问题:ECG基础模型的全面基准

Looking Beyond Accuracy: A Holistic Benchmark of ECG Foundation Models

模型评测评测方法与指标

摘要

心电图(ECG)是一种经济、高度可及且广泛使用的诊断工具。随着基础模型(FM)的出现,AI辅助ECG解读领域开始演进,因为它们通过依赖嵌入实现跨任务的模型复用。然而,要负责任地使用基础模型,关键在于严格评估其产生的嵌入的泛化程度,尤其是在医疗这类对错误敏感的领域。尽管先前工作已经处理过ECG专家基础模型的基准问题,但它们主要聚焦下游性能评估。为填补这一空白,本研究旨在为基础模型建立一个深入、全面的基准框架,特别聚焦ECG专家模型。为此,我们引入一种基准方法,在性能评估之外补充表示层面的分析,利用SHAP和UMAP技术。此外,我们依托该方法,对多个经由最先进技术预训练、来自不同跨洲数据集与数据可得性设置的ECG专家基础模型进行广泛评估;其中包括数据稀缺的设置,这在真实医疗场景中相当常见。实验结果表明,我们的基准协议为ECG专家基础模型的内嵌模式提供了丰富洞见,使其表示结构与泛化能力得到更深入的理解。

超越准确率看问题:ECG基础模型的全面基准
图2:所涵盖的所有 FM 在 AF (a-f) 与 CD (g-l) 类别上基于 UMAP 的嵌入空间可视化。样本按 ground-truth 标签着色。各面板按列顺序排列。