论文

理性之声:数学口语的强化学习

Voice of Reason: Reinforcement Learning for Spoken Math

模型训练强化学习

摘要

与级联系统相比,语音语言模型能够实现人与机器之间更丰富的口头交互,从而允许访问副语言信息并降低延迟。然而,它们在数学推理基准上的准确性落后于文本模型。具有可验证奖励的强化学习(RL)有助于扩展文本模型解决复杂问题和限制幻觉的能力。在这项工作中,我们探索将强化学习应用于 GLM-4-Voice 语音模型(Zeng 等人,2024),以弥合文本和口语数学问题解决之间的差距。我们首先对合成的语音问答数据进行监督微调,使模型适应该领域。然后我们表明,即使没有额外的推理标记,RL 也能提高 GSM8K 上的准确性,超出了之前仅使用补充推理轨迹的语音模型所达到的水平。当与现有的流推理技术相结合时,我们的自由形式准确率进一步提高到 74.8%。这通过语音原生模型建立了数学口语能力的新的最先进水平。