论文
资源匮乏的印度语言中音频滥用检测的少镜头对比适应
Few-Shot Contrastive Adaptation for Audio Abuse Detection in Low-Resource Indic Languages
摘要
辱骂和仇恨言论越来越多地以口头而非书面形式出现,出现在语音笔记、电话和短片中。大多数检测系统仍然会在分类之前将语音转录为文本,但对于缺乏强大语音识别器的语言来说,转录是不可靠的,并且它会丢弃通常带有滥用行为的语气和情感。本文研究了是否可以使用 CLAP 直接从音频中检测辱骂性言语。CLAP 是一种学习声音和语言的共享表示的模型,并在 ADIMA 数据集中的十种印度语言中进行了评估。在 CLAP 现有音频表示上训练的轻量级分类器,无需调整模型本身,与完全监督的系统相差一到三点,并且远远优于完全没有标记示例的提示。进一步适应每种语言的少量标记示例几乎不会带来额外的好处,不同语言之间的差异是不可预测的。因此,基于 CLAP 的音频表示已经为检测跨语言的辱骂性语音提供了强大且廉价的基础,从而减少了实践中所需的标记数据。