论文

AuRA:将音频理解作为 LoRA 内化到 LLM 中

AuRA: Internalizing Audio Understanding into LLMs as LoRA

摘要

最近将 大语言模型 (LLM) 扩展到语音输入的努力通常依赖于级联 ASR-LLM 管道、端到端语音语言模型或基于桥/蒸馏 的自适应。虽然这些路由分别重用强大的预训练组件、实现本地语音语言交互或提供轻量级自适应,但它们经常遭受转录界面延迟、昂贵的多模态训练或顺序语音语言耦合的困扰。为了解决这些限制,我们提出了 AuRA,这是一种将音频编码功能提炼到 LLM 中的方法。具体来说,AuRA 通过轻量级音频嵌入层将相同的语音输入馈送到 ASR 编码器(作为教师)和 LoRA 适配的 LLM(作为学生),并使用逐层 蒸馏 将学生的隐藏状态与相应的教师表示对齐,从而将语音表示内部化为轻量级 LLM 侧自适应。与级联和串行桥接方法相比,AuRA 能够实现更紧密的语音语言联合建模和高效的并行端到端推理,同时还可以重用预训练的语音和语言模型,而不需要大规模的多模态训练。在多个语音语言基准上,AuRA 在有效性和效率方面始终优于级联系统、语音到 LLM 适应基线以及大规模语音语言和多模态模型。