论文
Audio-Cogito:在大型音频语言模型中进行深度音频推理
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
摘要
推理模型的最新进展推动了文本和多模态领域的重大进展,但音频推理仍然相对有限。只有少数大型音频语言模型 (LALM) 包含显式思想链 (CoT) 推理,并且它们的功能通常不一致且不足以完成复杂任务。为了弥补这一差距,我们推出了 Audio-Cogito,这是一种用于深度音频推理的完全开源解决方案。我们开发了 Cogito-pipe,用于高质量音频推理数据管理,生成 545k 推理样本。基于该数据集,我们对模型 微调 采用自 蒸馏 策略。在唯一评估 CoT 过程的音频基准 MMAR 基准上的实验表明,我们的模型在开源模型中实现了最佳性能,并且在特定指标上匹配或超越了某些闭源模型。我们的方法还在 Interspeech 2026 音频推理挑战赛中跻身顶级系统之列。