论文

X$^3$-OPD:通过 同策略 对齐将推理提炼为大型音频语言模型

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

摘要

虽然大型音频语言模型在听觉感知方面取得了显着的进步,但在深度逻辑推理方面仍然落后于基于文本的 大语言模型,这主要是由于高质量音频推理数据的稀缺。为了弥补这一差距,我们提出了 X$^3$-OPD,这是一个跨模式 同策略 蒸馏 框架,它将推理能力从强大的文本教师转移到音频语言学生。在训练期间,学生根据自己的声学感知生成推理轨迹,而教师则使用匹配的文本输入和经过验证的答案提供 词元级 指导。我们进一步构建了一个三层对称语料库,涵盖呈现为语音的文本推理、基于复杂声学场景的音频事件推理以及涉及副语言线索的口语对话推理。此设计将跨模式 蒸馏 扩展到文本可恢复内容之外,扩展到基于非语言事件、韵律和对话上下文的推理。在 MMSU、MMAU、BIG Bench Audio 和 MMAR 上的实验表明,X$^3$-OPD 极大地提高了基于音频的推理和思想链质量,同时在很大程度上保留了模型在域转移下的现有功能。