论文
EchoDistill:通过嘈杂到干净的自我实现稳健的大型音频语言模型 蒸馏
EchoDistill: Robust Large Audio Language Models via Noisy-to-Clean Self-Distillation
摘要
大型音频语言模型 (LALM) 仍然容易受到声学噪声的影响,这可能会掩盖与任务相关的证据并产生不可靠的响应。我们提出了 EchoDistill,一个从噪声到干净的自 蒸馏 框架,它在 后训练 期间使用干净的音频作为特权信息。噪声输入学生对反映其推理时间行为的候选响应进行采样,而同一主干的冻结副本则处理相应的干净音频。 EchoDistill 结合了屏蔽响应词元 蒸馏、任务门控一致性塑造和教师参考的组相关优化,使噪声输入生成与干净条件语义保持一致。在推理时仅保留学生,不会引入额外的推理成本。在 -10dB 的三个 LALM 主干和三个音频域中,EchoDistill 将平均噪声输入精度比最强基线提高了 1.63 个百分点。在 Qwen2.5-Omni 上,它将噪声输入准确度从 59.33% 提高到 62.94%,而干净音频准确度从 76.56% 提高到 77.56%。用随机、随机或无声输入替换匹配的音频会降低准确度 3.08-6.42 个点,这证实了匹配的声学证据有助于其预测。其他评估显示了保留的加性噪声和外部基准的改进,同时揭示了这些增益并不能可靠地扩展到非加性失真。这些结果证明了 后训练 在严重的附加噪声下的强大改进,而不会牺牲跨不同任务的干净音频能力。