论文

RetroThinker:在语音中启用回顾性思维 LLM

RetroThinker: Enabling Retrospective Thinking in Speech LLMs

模型训练偏好优化

摘要

语音 大语言模型 (SpeechLLM) 可减少延迟并保留副语言的细微差别,而这些细微差别通常在级联自动语音识别 (ASR) 和基于文本的 LM 架构中丢失。然而,它们在复杂推理任务上仍然落后于纯文本 LLM,而实时语音交互则施加了严格的延迟限制。尽管先前的工作采用思想链(CoT)和并发推理来增强推理能力,而不会引起令人望而却步的延迟,但固有的准确性与延迟之间的权衡仍然存在。在本文中,我们研究了流式 SpeechLLM 是否可以动态地动态修改其推理轨迹。我们引入了 RetroThinker,这是一个多阶段 后训练 框架,它使 Moshi 模型能够在推理过程中进行自我验证和前向校正 CoT 步骤。 RetroThinker 将精心策划的回顾性思维数据上的监督 微调 (SFT) 与基于长度的直接偏好优化 (DPO) 相结合,以优化早期推理期间的回顾(即,在用户说话时同时进行推理)。根据 GSM8K 基准进行评估,RetroThinker 显着改善了非回顾性基线的准确性与延迟权衡,在相当的延迟下实现了 11% 的绝对准确性增益。