论文

超越转录:感知感知 AudioLLM 的统一音频架构

Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

模型训练监督微调与指令调优

摘要

最近的 Audio 大语言模型 (AudioLLM) 表现出惊人的性能反转:虽然在复杂的推理任务中表现出色,但它们在细粒度的声学感知方面始终表现不佳。我们将这一差距归因于以 ASR 为中心的训练的基本限制,该训练提供了精确的语言目标,但隐含地教导模型将副语言线索和声学事件抑制为噪音。为了解决这个问题,我们提出了统一音频模式(UAS),这是一个整体和结构化的监督框架,它将音频信息组织成三个显式组件——转录、副语言和非语言事件——采用统一的 JSON 格式。这种设计实现了全面的声学覆盖,而不会牺牲支持推理的紧密音频文本对齐。我们通过将其应用于离散和连续 AudioLLM 架构来验证该监督策略的有效性。在 MMSU、MMAR 和 MMAU 上进行的大量实验表明,UAS-Audio 产生了一致的改进,与相同大小的最先进模型相比,MMSU 的细粒度感知提高了 10.9%,同时保留了强大的推理能力。我们的代码和模型已公开在 https://github.com/Tencent/Unified_Audio_Schema 上。