论文

通过与语言无关的发音特征改进零样本语音分类

Improving Zero-Shot Phonetic Classification through Language-Agnostic Articulatory Features

模型评测模型能力评测

摘要

最近用于语音到 IPA 转录的语音基础模型 (PFM) 依赖于字素到音素 (G2P) 标签,但音素标签不一定在语音上忠实。为了研究这个问题,我们评估了汉语送气音和日语摩拉鼻音的零样本语音分类。对不包括这两种语言的 G2P 标记数据进行训练的 PFM 在这两项任务上的准确性都很差,这表明使用离散 IPA 标记的多语言覆盖不足以应对看不见的设置。为了克服这个限制,我们提出了一种基于从每帧提取的连续发音特征(AF)向量的分类方法。这种基于 AF 的方法优于基于离散词元的方法,特别是对于稀有手机。我们进一步表明,采用 AF 向量的最佳时间聚合对于目标区分至关重要:单帧分类最适合抽吸,而分段分类则大大改善了鼻部分类。