论文

MOSS-音频技术报告

MOSS-Audio Technical Report

应用与实践通用理解与问答

摘要

MOSS-Audio 是一种用于语音、环境声音和音乐理解的统一音频语言模型,支持音频音频描述、时间感知问答、时间戳转录和基于音频的推理。 MOSS-Audio 将专用音频编码器与模态适配器和 大语言模型 相结合:编码器产生 12.5 Hz 时间表示,适配器将它们投影到解码器空间,解码器生成自回归文本输出。两个设计选择是系统的核心:DeepStack 跨层特征注入,将解码器暴露于来自多个编码器深度的声学信息;时间标记,通过将时间戳标记插入音频词元流来提供明确的时间线索。在数据层面,我们设计了一个保留事件的音频注释管道,该管道在连贯的事件边界处分割原始音频,将特定于分支的注释应用于语音、音乐和一般音频,并将结果合并到统一的音频描述中以进行预训练。进一步保留中间分支特定的文本描述,以支持面向任务的 SFT 数据的构建。该模型在大规模音频语言数据上进行预训练,并结合时间感知目标来支持时序定位,然后进行多阶段 后训练 以增强指令跟踪和基于音频证据的推理。我们在 Instruct 和 Thinking 配置中发布了 4B 和 8B 变体。 MOSS-Audio 在一般音频理解、语音音频描述、ASR 和时间戳 ASR 方面实现了强大的性能,将其定位为未来语音代理的有前途的理解基础。