论文
通过 LLM 增强音频文本对齐进行零样本呼吸声音分类
Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment
摘要
自监督呼吸编码器缺乏零样本推理所需的临床领域的语义基础,在没有特定于任务的标记数据的情况下限制了它们的实用性。我们提出了一个框架,将这些编码器与共享潜在空间中的医学术语对齐,将它们转变为具有零样本能力的基础模型。为了解决配对数据稀缺问题,我们使用医学 LLM 从元数据合成结构化报告,为对比学习创建密集的语义锚。我们的训练将基于 sigmoid 的对比损失与编码器的本机 SSL 目标和相似性感知负采样相结合,以锐化病理边界。在 6 个数据集的 9 项任务中,我们的方法实现了 61.3% 的平均零样本 AUC,超过了 CLAP (51.4%) 和 Qwen2-Audio (54.9%),同时达到了最高的线性探测 AUC (71.6%),仅使用全尺寸基线的 43% 的数据,表明结构化语义对齐优于临床诊断中的大规模通用模型。