论文
RespiraMFM:用于呼吸系统疾病识别的具有对比音频语言对齐的多模态基础模型
RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification
摘要
呼吸系统疾病仍然是全球死亡的主要原因,及时、准确的诊断对于改善患者治疗结果和减轻医疗负担至关重要。虽然之前的工作已经探索了用于呼吸系统疾病检测的基于音频的模型,但这种单峰方法通常普遍性和诊断精度有限。在本文中,我们提出了 RespiraMFM,这是一种多模态基础模型,它将呼吸音与患者病史和症状相结合,以提高诊断准确性和疾病检测能力。我们引入了一种用于音频文本多模态集成的有效对比对齐策略,使模型能够学习呼吸音和相应文本临床信息之间更好的跨模态表示。我们在有监督的 微调 和零样本设置中使用七个真实世界数据集来评估针对五种主要呼吸系统疾病的 RespiraMFM,与现有基线相比,监督任务的 AUROC 提高了 9.15%,零样本任务的 AUROC 提高了 20.98%。这些发现强调了我们的框架在推进早期诊断和改善呼吸系统疾病管理临床决策方面的潜力。