论文
CARD:跨组件蒸馏实现推理时无音频编码器的音频描述
CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning
摘要
自动音频描述系统通常通过可训练投影器,把冻结的音频编码器接入LLM,因而承担编码器推理成本,并受固定声学特征限制。CARD在推理时移除音频编码器:一个1320万参数投影器向冻结LLM提供输入,LoRA适配器合并进入模型,训练时使用的教师不再参与推理。CARD将预训练音频教师CLAP-HTSAT的表征分配到不同组件:感知阶段蒸馏给投影器,语义阶段蒸馏给LLM,而非全部只注入LLM。相比仅向LLM蒸馏,在AudioCaps和Clotho上CIDEr-D分别提高11.9与5.0;无编码器方案得分为55.4,保留编码器的上限为66.4。结果表明,教师知识放在哪个组件,与是否使用教师同样重要。