论文

推理 LLM 提高长篇电视剧中的说话人识别能力

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

应用与实践语音识别与转写

摘要

长篇电视剧对全面的视频理解提出了巨大的挑战,其中破译复杂的故事情节通常依赖于 \textbf{说话人识别},即准确地将每个口语归因于其各自角色的任务。在本文中,我们通过两项主要贡献推动了这一领域的发展。 (1) 我们引入了 \textbf{DramaSR-532K},这是一个大型基准,包含 532K 条带注释的对话台词,涵盖 900 多个独特的字符,需要整合听觉、语言和视觉线索来识别说话人。 (2) 我们提出 \textbf{DramaSR-LRM},这是一种基于大型推理模型(LRM)的稳健方法。 DramaSR-LRM 旨在通过多模式工具使用自动聚合上下文证据,综合不同的输入以实现高保真归因。实验结果表明,DramaSR-LRM 的性能显着优于现有基线,特别是在声学生物识别技术本质上不可靠的短语句上。 \textit{所有数据和代码将在项目页面公开:https://www.github.com/198808xc/DramaSR-LRM。}