论文
使用 REAL-2MIX 和 VOXBLINK2-AVSE 进行忠实身份的视听目标说话人提取
Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE
摘要
视听目标说话人提取应返回视频指示的说话人,但分离器可以忽略视觉提示并重复输出声学主导语音。我们推出 REAL-2MIX,这是一个普通话 AV-TSE 基准,使用同步多视图视频联合录制真实的两个说话人混合。每个场景还包含前面的仅 A 和仅 B 阶段,提供场景内说话人参考。它包含 77 个场景和 7,598 个剪辑(11.84 小时),其中包括 6,042 个双注释混合物。处理后,留下 6,038 个可评估的混合物和 12,076 个目标说话者行。我们还从 VoxBlink2 中精选了 VOXBLINK2-AVSE,其中包含来自 28,421 个身份和 766.17 小时语音的 250,828 个同步音频-唇形-ROI 对。我们的提取器使用冻结的 1,280 维投影 AV-HuBERT 特征、目标条件训练和分层特征调制。我们使用 Qwen3-ASR-1.7B CER 联合评估内容,并使用 WeSpeaker ResNet34 和重叠语音检测 (OSD) 联合评估目标身份。在完整的清单上,最佳存档检查点获得 0.2261 CER、82.22% 严格输出正确性和 69.53% 两者输出严格成功率。