论文

Au-M-ol:医学音频和语言理解的统一模型

Au-M-ol: A Unified Model for Medical Audio and Language Understanding

应用与实践语音识别与转写

摘要

在这项工作中,我们提出了 Au-M-ol,一种新颖的多模态架构,它通过音频处理扩展了 大语言模型 (LLM)。它旨在提高自动语音识别 (ASR) 等临床相关任务的性能。 Au-M-ol 具有三个主要组件:(1) 从医学语音中提取丰富声学特征的音频编码器,(2) 将音频特征映射到 LLM 输入空间的适应层,以及 (3) 执行转录和临床语言理解的预训练 LLM。这种设计允许模型直接解释口头医疗内容,从而提高准确性和稳健性。在实验中,与医学转录任务的最先进基线相比,Au-M-ol 将字错误率 (WER) 降低了 56%。该模型在具有挑战性的条件下也表现良好,包括嘈杂的环境、特定领域的术语和说话者的可变性。这些结果表明,Au-M-ol 是现实临床应用的有力候选者,其中可靠且上下文感知的音频理解至关重要。