论文

TEMPO:用于大型音频语言模型的时间定位多任务后训练

TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

模型训练监督微调与指令调优

摘要

大型音频语言模型 (LALM) 描述剪辑级别的音频,但无法为它们识别的事件、扬声器或声音分配时间戳。尽管时间戳对于语音识别和密集音频字幕等下游任务至关重要,但它仍然是大多数 LALM 的一个关键限制。我们提出了 TEMPO(时间定位多任务 后训练),这是第一个处理音频、语音和音乐时间戳任务的统一模型。我们的核心贡献是基于三项创新的监督 微调 (SFT) 阶段:原子时间戳词元、将正弦挂钟编码注入音频帧嵌入的时间感知投影器,以及距离感知高斯损失。我们的训练基于从合成到真实的课程。据我们所知,我们进一步介绍了强化学习在统一音频时间戳中的首次应用,使用具有可验证时间奖励的 GRPO 来直接优化评估目标。 GRPO 不是作为性能提升的主要来源,而是作为 SFT 检查点之上的细化阶段,提供适度的额外改​​进。为了支持这项工作,我们构建了一个包含 119K 个样本的训练数据集和一个包含 10K 个样本的评估基准,这些样本是从跨五个任务的已建立的语料库中提取的。在此基准测试中,TEMPO 的性能优于 Audio Flamingo Next 和 Qwen3-Omni,这两种最先进的 LALM 均经过时间戳数据明确训练。实验证实,SFT 提供了大部分收益,GRPO 提供了一致但适度的改进。