论文

VieSpeaker:超越视觉依赖的大规模越南语说话人识别数据集

VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

模型评测基准与评测资源

摘要

说话人识别在大规模训练数据集的帮助下取得了迅速发展,但越南语仍然资源不足,现有语料库的规模和声学多样性有限。大多数大型数据集依靠面部线索将语音与说话者身份联系起来,从而将数据收集限制为说话者出现在摄像机上的录音。我们提出了一种与人脸无关的数据集构建流程,并引入了大型越南语说话人识别数据集 VieSpeaker。我们的方法利用文本元数据和 大语言模型 推理从文字记录和上下文信息推断说话者身份。 VieSpeaker 包含 4,715 名发言者的大约 902 小时的演讲。实验表明,与现有越南语数据集相比,在 VieSpeaker 上训练的模型实现了更高的鲁棒性和泛化性。这项工作证明了与人脸无关的数据集构建的可行性,并为构建大规模语音资源提供了新的方向。