论文
RT-OPD:以奖励重加权的同策略蒸馏增强音频语言模型的声学证据依赖
Reward-Tilted On-Policy Distillation for Acoustic Grounding in Audio-Language Models
摘要
音频语言模型 (ALM) 可以利用文本快捷方式来回答问题,同时忽略声学证据,从而削弱音频理解。同策略蒸馏 (OPD) 通过监督学生生成的响应和教师的预测来训练紧凑的 ALM,但没有明确区分声学支持和语言可预测性。我们提出奖励倾斜的同策略蒸馏(RT-OPD)来加强声学基础。给定相同的问题和学生生成的文本,冻结的老师会在有或没有音频输入的情况下预测下一个标记。他们的对数概率对比定义了一种奖励,可以重塑反向 KL 蒸馏的教师分布,强调音频提供的额外证据。在两个紧凑型学生和三个基准测试中,RT-OPD 的表现始终优于 Vanilla OPD。使用静音和替换音频的实验进一步表明,RT-OPD 增强了学生对声学证据的依赖。我们的3B模型在MMAU上达到了72.72%的准确率,是比较的3B模型中最高的,并且与几个7B和8B模型具有竞争力。代码和模型检查点可从此 https URL 获取。