论文

CoughSense:通过 Whisper 编码器 微调 和双编码器交叉注意融合与平衡对比学习进行五级呼吸道疾病分类

CoughSense: Five-Class Respiratory Disease Classification via Whisper Encoder Fine-Tuning and Dual-Encoder Cross-Attention Fusion with Balanced Contrastive Learning

模型优化小模型/轻量模型

摘要

自动咳嗽分析提供了一条低成本呼吸道筛查的途径,但大多数现有工作停留在二元 COVID-19 检测上。一个实用的工具需要从消费者智能手机上的一次咳嗽记录中区分出几种呼吸系统疾病。我们推出了 CoughSense,这是一个将咳嗽录音分为五类的系统。这些是健康、COVID-19、哮喘或呼吸道疾病、支气管炎和肺炎。我们汇总了来自四个公共数据集(Coswara、CoughVID、Virufy 和华西医院儿科咳嗽数据集)的 18,301 条记录,并使用 OpenAI Whisper 编码器作为咳嗽疾病分类的预训练主干。主要贡献是主动帧 QKV 注意力池,它将注意力限制在 1500 个编码器词元中的前 200 个。这避免了由于 3 秒的咳嗽仅填充 Whisper 30 秒输入窗口的 150 个词元而出现的沉默稀释问题。其他训练部分处理 19 比 1 的类别不平衡和四数据集域转换。其中包括 WeightedRandomSampler、SpecAugment、带有强制少数配对的平衡混合、监督对比辅助损失、FiLM 症状调节和梯度反转域适应。双编码器模型通过交叉注意力将 Whisper 与 OPERA-CT 呼吸基础模型融合在一起。 CoughSense(Whisper-tiny,860 万个参数)在五重交叉验证中达到了 82.3% 的平衡准确率(宏观 F1 为 0.817,AUC 为 0.941)。它比 ImageNet 预训练的 EfficientNet-B2 领先 11.1 分,比从头训练的 ViT 领先 29.6 分。所有五个类别的召回率均达到 74%,五个类别中的四个类别的召回率达到 80%。双编码器模型达到了85.4%的平衡精度。活动帧池是所有消融组件中最大的单一贡献者,得分为 5.1,这应该有助于任何使用 Whisper 作为骨干的短音频任务。