论文
统一音频智能而不退化文本智能
Unified Audio Intelligence Without Regressing on Text Intelligence
摘要
音频智能涉及理解、推理和生成音频和语音。在这项工作中,我们介绍了 Nemotron-Labs-Audex-30B-A3B (Audex),这是一个基于 Nemotron-Cascade-2-30B-A3B(强大的纯文本 MoE LLM)构建的统一音频文本 LLM。 Audex 采用简单的统一设计,带有单个 Transformer 解码器:音频输入被编码并投影到文本嵌入空间中,而文本标记和量化音频输出标记在生成过程中被统一处理。该架构可实现强大的音频文本融合、无缝多模式生成以及与标准 LLM 训练和推理基础设施的兼容性。对于训练,我们精心策划了包含 157.4B 音频标记和 320.5B 文本标记的音频文本数据集。我们对这些数据集应用多阶段监督训练,然后是纯文本 Cascade RL 和多域 同策略 蒸馏。 Audex 提供最先进的音频理解、语音识别和翻译、文本到语音、音频生成和语音到语音生成,同时保留其纯文本 LLM 主干的非常引人注目的推理、对齐、知识、长上下文和代理功能,具有边际或无回归。我们发布模型检查点以促进开放研究。