论文

CaReCoS:基于频谱图的心脏、呼吸和咳嗽声音视觉基准

CaReCoS: A Spectrogram based Visual Benchmark for Cardiac, Respiratory and Cough Sounds

模型评测基准与评测资源

摘要

呼吸音、心脏听诊和咳嗽音频等医学声学信号携带丰富的诊断信息,但现有的基准还没有评估其频谱图表示的多模态推理。我们通过 CaReCoS 解决了这两个差距,CaReCoS 是一个基准,将具有临床依据的问题与源自七个医学音频数据集的梅尔频谱图图像配对。通过评估 9 个最先进的视觉和全向模型,我们发现所有模型都在与频谱图中编码的细粒度声学特征作斗争:没有模型能够可靠地将视觉模式识别与医学知识结合起来,达到 51.2% 的最大准确度,这凸显了医学声音可视化训练的必要性。