论文
离散与连续:LALM 中统一音频理解的综合研究
Discrete vs. Continuous: A Comprehensive Study of Unified Audio Understanding in LALMs
摘要
大型音频语言模型 (LALM) 使用连续特征或离散标记,但一般音频理解的最佳表示范式仍然存在争议。现有的基准测试通常关注狭窄的领域或评估 LALM 上下文之外的编码器。为了解决这些差距,我们系统地评估了语音、声音和音乐的连续和离散表示。利用我们的 UniARC 框架和跨模型规模(从 SmolLM2-135M 到 Llama-3-8B)的双重评估策略,我们分析了数据量、模型容量和计算效率的动态关系。我们的结果揭示了语义约束在音频理解标记化中的关键作用,并证明扩展主干网无法补偿音频表示中的信息丢失,尤其是在数据有限的任务中。这些发现为未来 LALM 中平衡语义密度、保真度和效率提供了实用指导。