论文

同步:针对 ASR 的语音感知 大语言模型 的调整,具有字级时间戳预测

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions

模型训练监督微调与指令调优

摘要

语音感知语言模型的最新进展将强大的声学编码器与 大语言模型 结合起来,使系统能够超越转录以产生更丰富的输出。其中,字级时间戳预测对于字幕、媒体搜索和多模式同步等应用至关重要,但它通常由外部对齐工具处理。在这项工作中,我们扩展了现有的语音感知语言模型,以直接与转录本一起预测时间戳。我们引入了一组新颖的轻量级训练策略,可以提高对齐鲁棒性,同时保持识别质量。跨多个数据集的实验表明,这些策略不仅提高了时间戳准确性,而且还提高了整体 ASR 性能。它们共同展示了一种高效、统一的语音识别方法,具有精确的时间戳预测。