论文
SpeakerCard-1M:用于野外说话人验证的循证语料库
SpeakerCard-1M: An Evidence-Grounded Corpus for In-the-Wild Speaker Verification
摘要
现代说话人验证(SV)系统依赖于有效但难以用自然语言解释或查询的说话人嵌入。大多数现有的语音文本语料库都以可控合成或话语级描述为目标,为野外说话人识别提供有限的说话人级监督。本文介绍了SpeakerCard-1M,这是一种基于证据的SV的双语说话者资源,源自VoxCeleb1/2和CN-Celeb1/2,其中“-1M”后缀指的是版本中包含的1.78M话语级描述。我们采用工具优先、LLM-last 的方法,其中十个声学探针产生字段级证据,证据在将相对稳定的特征与话语级状态分开的模式下聚合到说话者配置文件中,双语说话者卡由仅看到结构化字段的受约束的 LLM 呈现。该版本包括超过 10.2k 发言者的 56.7k 发言者卡记录、1.78M 话语级描述以及发言者 ID 不相交的硬负三元组。我们进一步定义了两种面向 SV 的跨模态协议,即双向说话人文本检索 (T2S-R / S2T-R) 和属性条件验证 (AC-Verify),并在零样本强制选择设置下将双编码器基线与最新的音频语言模型进行比较。相对于纯音频基线,在 VoxCeleb1-O 上联合音频-文本训练的绝对 EER 仅花费 0.31%。在风格对称的 LLM 生成的反事实协议下,最近的 8 个音频语言模型(7B-30B+ 参数,开源和闭源)在 2 路强制选择设置中的音调级 AC-Verify 得分为 49-77%,而我们的双编码器得分为 88.66%。