论文
OP-CAD:用于稳健视听推理的政策性清洁音频蒸馏
OP-CAD: On-Policy Clean-Audio Distillation for Robust Audio-Visual Reasoning
摘要
在现实环境中部署的全模态大语言模型会遇到外部噪声,这些噪声可能会干扰它们对多模态输入的感知和理解。我们研究它们在视听理解方面的鲁棒性,重点关注环境噪声和竞争语音下的问题回答。面临的挑战是抵抗声学干扰,同时保留有用的音频证据。策略蒸馏为学生生成的响应提供了密集的教师反馈,但统一的词元加权并没有明确优先考虑受声学干扰影响的位置。我们引入了 OP-CAD(On-Policy Clean-Audio Distillation),这是一种基于课程的特权自蒸馏框架,用于强大的视听理解。训练从轻微到严重的环境噪声和竞争性语音进行,每个阶段都有选择性的词元级监督。学生从损坏的视听输入中生成响应,而冻结的老师使用干净的音频和经过验证的答案来监督相同的响应前缀。为了分配这种监督,OP-CAD 会比较教师在干净、损坏和仅视觉环境下的预测,但不会透露答案。这些匹配的比较测量对音频删除和损坏的敏感度;有界加权规则强调由任一信号识别的位置,同时在整个响应过程中保持监督。在所有评估的噪声条件下,OP-CAD 的性能均优于对比方法。配对分析进一步表明,在强干扰下,干净正确答案的保存得到了改善,并且没有观察到总体干净准确性损失。这些结果证明了将干净的教师监督引导到声学敏感预测以实现稳健的视听推理的价值。