论文

Mizar:用于音频理解的 159M 参数音频语言模型

Mizar: A 159M-Parameter Audio-Language Model for Audio Understanding

模型优化小模型/轻量模型

摘要

音频语言模型 (ALM) 将声学感知与语言模型中编码的知识相结合,从而实现对听觉事件的上下文理解。让这些功能在内存和计算有限的设备上变得实用,促使我们关注参数少于 200M 的小型 ALM。我们引入了一个方法,它将架构、数据和三阶段训练结合在一起来构建 Mizar,一个 159.3M 参数的 ALM。其架构通过频率合并映射器将紧凑型 CED-Small 音频编码器连接到 SmolLM2-135M。在 ReasonAQA、AudioMCQ 和 AVQA 的监督下,该模型经历了三个训练阶段:音频语言对齐(第 1 阶段)、音频相关微调(第 2 阶段)和训练后(第 3 阶段),旨在加强薄弱技能,同时保留学到的能力。在五个随机种子中,Mizar 在 MMAU 上的平均准确度为 52.92%,在 MMAR 上的平均准确度为 42.42%,在 ADQA-clean 上的平均准确度为 36.02%,在所有三个基准上都超过了之前性能最佳的低于 200M 参数的 ALM。它还支持在单个 CPU 上进行本地推理:对于 MMAU 基准测试的问题,从打开音频文件到生成完整答案的平均延迟为 1.09 秒。代码和检查点可从此 https URL 获取。