用于 ECG 图像分类的生理学感知 CNN 和零样本多模态 LLM:比较研究
Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study
摘要
多模态 大语言模型 (LLM) 越来越多地用于解释 12 导联心电图图像,但解释通常缺乏验证。然而,心电图图像理解与一般图像显着不同,因为它依赖于精确的波形形态、导联关系和准确的间隔测量。本研究调查了零样本多模态 LLM 是否能够可靠地区分正常和异常心电图图像,同时评估基于 CNN 的模型以供临床参考。标准 12 导联心电图记录被渲染为单页图像,用于二元正常-异常分类任务。三个著名的 LLM(GPT-5.2、GPT-4.1 和 Gemini-2.5 Pro)在多次运行中使用固定的零样本提示进行了测试。与此同时,开发了一个基于 CNN 的生理学模型,该模型能够聚合来自预定义的解剖学主导组的特征。该模型与 ResNet18、DenseNet121、VGG16 基线进行了比较,并且所有模型都在内部测试集和外部 PTB-XL 数据集上进行了评估。在种子中,基于 CNN 的模型表现出稳定的辨别力,平均内部 ROC-AUC 为 0.92-0.94,外部 ROC-AUC 为 0.85-0.86。所提出的 LeadGroupECG 模型在不影响外部泛化的情况下显着改进了其内部主干。它与其他基线相比仍然具有竞争力,同时始终强调解剖学领导小组的贡献。相比之下,零样本 LLM 歧视仍然接近机会(ROC-AUC 约为 0.5)。与无网格心电图相比,当心电图使用基于网格的校准背景时,PR-AUC 略有改善。尽管多模态 LLM 可以生成合理的心电图叙述,但其零样本诊断辨别能力仍然有限。因此,临床框架、特定领域的架构对于基于人工智能的心电图解释仍然至关重要。