论文
边说边思考:一种用于实时语音生成的受控交错推理方法
Thinking-while-speaking: A Controlled, Interleaved Reasoning Method for Real-Time Speech Generation
摘要
边思考边说的范式旨在让人工智能沟通更加人性化。一个关键的挑战是在进行深度推理的同时保持流畅的言语。我们的方法 InterRS 通过仅在自然语音生成期间插入推理步骤来解决这个问题。这需要高质量的数据,其中推理和语音精确对齐,并且长度比例受到控制。我们引入了一种新颖的管道来生成这种无缝交错的音频数据。为了训练我们的模型,我们将交错 SFT 与精炼数据和强化学习相结合,并提供两种新的奖励:用于管理时间和思考答案比率的 TA-Balance 奖励,以及用于精炼表达的语言质量奖励。实验表明,我们的方法在数学和逻辑基准测试上的性能提高了 13%,同时生成即时响应,就像输出快速 CoT 响应的口语指令模型一样。此外,我们的方法比以前的方法生成更自然、更流畅的答案。