论文
您所需要的就是对齐:通用音频语言模型的免指导训练
Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models
摘要
多模态 大语言模型 (MLLM) 通常通过多级管道构建,其中包括跨模态对齐、监督 微调 (SFT) 和偏好优化。该管道假设使 LLM 适应新的模式需要广泛的特定于任务的监督。然而,经过预训练的LLM已经具备强大的推理和指令跟踪能力。随着 LLM 的快速发展,一个重要的问题仍然存在:我们能否以最少的干预有效地将这些功能转移到新的模式,并且仅靠对齐就足以构建多模式模型吗?我们引入了一种无指令对齐大型音频语言模型 (LALM),该模型使音频编码器和 LLM 完全冻结,仅学习轻型投影仪。借鉴 AzeroS [1] 的见解,我们对自生成数据构建中的(音频、响应)对进行训练,其中 LLM 将字幕扩展为自由格式的响应,无需明确的任务指令。在 MMAU、MMAR、MMSU 和 MMAU-Pro 中,我们的方法使用少得多的数据来匹配或超过经过大量训练后的基线。通过保持 LLM 冻结,我们的模型保留了其本机指令跟踪能力,并且可以跨模型代无缝移植。我们的结果表明,有竞争力的 MLLM 可以仅从对齐中出现,将多模态扩展减少为轻量级投影仪训练问题,该问题可以跨模态泛化并快速适应每个新的 LLM 版本。