论文
Indic-CLAP:通过跨语言蒸馏实现印度语言文本音频理解
Indic-CLAP: Text--Audio Understanding in Indic Languages via Cross-Lingual Distillation
摘要
对比语言-音频预训练 (CLAP) 学习联合文本-音频表示空间,从而能够从自然语言描述中进行零样本音频理解。然而,其仅限英语的文本编码器将 CLAP 限制为以英语表示的任务和数据集。我们推出了 Indic-CLAP,这是一种多语言文本音频模型,可将 CLAP 扩展到超过 10 亿人使用的九种印度语言。利用 CLAP 的双编码器结构,我们建议通过蒸馏仅训练印度文本编码器,同时使用机器翻译的 AudioCaps 字幕保持音频编码器冻结。我们比较了 CLAP 文本编码器、音频编码器以及结合两者的新颖混合目标的蒸馏。我们的评估表明,Indic-CLAP 编码器继承了 CLAP 教师的跨模态对齐,跨模态检索和零样本分类任务的性能证明了这一点。此外,我们使用模态差距分析来研究跨模态对齐,这解释了性能趋势。