论文

说话者推理器:缩放带有时间戳的说话者属性 ASR 的交互回合和推理模式

Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR

应用与实践语音识别与转写

摘要

转录和理解多说话者对话需要语音识别、说话者归因和时间戳本地化。虽然语音 LLM 擅长单说话人任务,但由于重叠语音、反向通道、快速轮流和上下文窗口限制,多说话人场景仍然具有挑战性。我们提出了Speaker-Reasoner,一种具有代理多轮时间推理的端到端语音LLM。该模型不是单通道推理,而是迭代分析全局音频结构,自主预测时间边界,并执行细粒度片段分析,联合建模说话者身份、性别、时间戳和转录。说话者感知缓存进一步将处理范围扩展到超出训练上下文窗口的音频。经过三阶段渐进策略的训练,Speaker-Reasoner 在 AliMeeting 和 AISHELL-4 数据集的强大基线上实现了持续改进,特别是在处理重叠语音和复杂轮流方面。