论文

相关性蒸馏使语音与音乐编码器更易合并

Correlation-Based Distillation Yields More Mergeable Speech-Music Encoders

摘要

一个同时处理语音与音乐的紧凑编码器可免除为每个领域维护独立模型。实用方案是将语音教师与音乐教师分别蒸馏为小型学生,再合并为一个模型。已有两种合并算法:从共同初始化的学生权重进行插值,或先排列通道使其对齐再平均。此前两者固定蒸馏损失,未回答损失本身是否影响合并效果。我们表明答案是肯定的。固定架构和评测,将DistilHuBERT损失Lkd替换为相关性损失Lcl。在权重插值下,Lcl学生在18次比较中的17次更接近自身较好的端点,并在每个插值权重上领先语音任务。在激活排列下,三个层需要重排的通道更少,匹配通道相关性更强,语音任务也再次领先。两种合并算法没有共同机制,却都在同一损失替换下改善,说明收益更可能来自Lcl形成的表征,而非某个合并算法。