论文

从分散式医疗音频中解锁音频语言模型中的情境学习

Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio

模型训练监督微调与指令调优

摘要

资源匮乏环境中的临床音频诊断需要模型在没有大型注释语料库的情况下从最少的示例中识别条件。我们提出了联合自我情境化(FSC),这是一种多模式语言模型框架,用于跨联合医院客户的情境临床音频诊断。 FSC 通过无监督的音频表示聚类构建伪标签片段,绕过稀缺的真实诊断标签,并支持从支持查询对进行上下文推理。我们的渐进式三阶段管道首先通过基于音频描述的预训练将音频嵌入与语言模型对齐,然后通过联合优化使其适应情景上下文推理。在测试时,给定一个小的标记支持集,该模型通过多模态推理诊断未见过的查询。在持续呼吸和心脏疾病方面,FSC 在 2 路 2 次评估中实现了 71.6% 的准确率,比音频语言基线高出 9% 以上。