论文
共生音频架构:向冻结语言模型 KV Cache 注入音频
Symbiotic Architecture for Post-Hoc Audio Extension of Frozen Language Models
摘要
本文提出一种无需微调大语言模型权重便赋予其音频理解能力的架构。共生架构利用注入器,把音频条件向量直接写入目标LLM的短期记忆,即键值缓存,使其作为音频语言模型运行。架构有两项优势。首先,音频注入绕过LLM,其成本由注入器宽度而非底座宽度决定,因此增长可慢于完整底座预填充成本,提高扩展性。其次,训练不更新LLM权重,从结构上保留原有能力,避免微调引起的退化。研究同时评估自动语音识别、音频问答、声学场景分类和纯文本任务。结果确认,音频预填充激活更少参数的同时,架构优于常规冻结LLM方法,接近微调音频语言模型的表现,并按设计保留底座原有纯文本任务性能。
