论文

角色身份不是说话者身份:角色验证的 KyaraBench 和 KyaraEmbed

Character Identity is not Speaker Identity: KyaraBench and KyaraEmbed for Character Verification

模型评测基准与评测资源

摘要

当声音执行模型改变时,配音角色保持其身份,因此角色身份和说话者身份是一个录音的不同属性,而说话者验证仅测量后者。为了解决这一差距,我们提出了 KyaraBench,这是一个直接对角色声音而不是说话者声音进行评分的基准,由配音动画语料库中的 85 个经过人工审核的身份构建。它提出了两个具有挑战性的条件:一种是在固定角色下交换表演者,另一种是在变化的角色下固定表演者。 78 名参与者参与的听力研究为交叉表演者验证和相同执行模型区分能力提供了人类参考分数。在这些特定于字符的条件下,Speaker-验证基线显示错误增加。然后,我们训练 KyaraEmbed,这是一种使用多语言字符监督、same-执行模型负数和语言对齐项的紧凑编码器。在主要比较中,该模型在所有特定于角色的条件下均实现了最佳性能。我们公开发布基准、协议和编码器。