论文

大声思考的口语模型

Spoken Language Models that Think Aloud

应用与实践语音交互与综合语音服务

摘要

虽然思想链(CoT)推理提高了语言模型的能力,但将其直接应用于口语模型(SLM)可能会在串行“思考然后说话”范式下引入较长的无声间隔,从而扰乱实时口语交互。为了解决这个问题,我们提出了一个异步有声思考框架,用于 Thinker-Talker 架构中基于推理的 SLM。该框架维护一个用于逻辑演绎的主要推理流和一个轻量级的有声思考流,该流根据用户输入和不断发展的推理状态生成简短的、基于任务的进度话语。动态平衡策略在运行时协调两个流,触发额外的有声思考语音以避免无声间隙,并在最终响应准备好时取消待处理的话语。口语推理和问答基准的实验表明,我们的方法大大减少了推理过程中用户可听见的沉默,同时保持与串行“思考然后说话”基线相当的答案准确性,展示了异步有声思考在 SLM 中响应交互的潜力。