论文

ECGQuest:心电图基准测试和 微调 语言模型

ECGQuest: Benchmarking and Fine-Tuning Language Models for Electrocardiography

模型评测基准与评测资源

摘要

心电图 (ECG) 解读需要心脏病学、电生理学、临床诊断、心电图波形、信号采集和仪器方面的知识。然而,现有的语言模型基准主要评估广泛的医学知识或单个心电图信号和图像的解释,而不是心电图解释所需的更广泛的上下文知识。我们开发了 ECGQuest,这是一种基于文献的资源,用于评估 微调 ECG 特定语言模型。基于 GPT-4o 的管道从 2003 年至 2025 年的 23 个心电图参考文献和心脏病学计算中产生了问题。最终数据集包含 10,904 个独特的真/假问题及其否定形式(21,808 个问答对)。我们在零样本设置的测试集上评估了 3 个商业语言模型和 20 个开源语言模型。使用低秩适应对五个具有 7-14B 参数的开源模型进行了微调,其中 BERT 和 BiomedBERT 作为监督编码器基线。对 MedMCQA 的心电图相关子集进行泛化评估,并使用官方答案将 MedQA 转换为二元真/假问题。 ECGQuest 的零样本准确率范围为 49.5% 到 74.4%,其中 GPT-5 表现最好。通用模型的表现优于医学专用模型,多个模型表现出强烈的真/假偏差,并且编码器基线的表现几乎是偶然的。 微调 将所有开源模型改进了 6.5-14.1%。经过微调的 DeepSeek-R1-Distill-Qwen-14B 达到了 76.3% 的准确率,而五模型投票集成达到了 78.5%。在 MedMCQA 和 MedQA 上,微调 主要使较弱或类别偏向的模型受益,并没有持续改进强基础模型。 ECGQuest 为上下文 ECG 知识提供了可重复的基准,并表明参数高效的 微调 可以使较小的语言模型与更大的商业模型竞争。