论文
深入思考,直接说话:副语言基础口语对话的循环潜在推理
Thinking in Depth, Speaking Directly: Recurrent Latent Reasoning for Paralinguistically Grounded Spoken Dialogue
摘要
善解人意的口语对话要求模型使用所说的内容和所说的方式来决定如何回应。显式 CoT 可以改善副语言感知并使答复中的声音提示更加明确,但不能确保它们在响应计划中的有效使用。我们将这种不匹配称为感知推理差距。此外,CoT 可能无法完全捕获单词中的声音线索,生成它会增加推理延迟。为了解决这些限制,我们引入了 LoopSLM,它建立在循环 Transformer 的基础上进行潜在推理,重用解码器块来细化隐藏状态,并在每次传递时都以声学为基础。它的两阶段训练通过将学习推理与学习响应分开,进一步缩小了感知推理差距,从而无需 CoT 即可进行直接推理。在 EchoMind 上,LoopSLM 比 Qwen2.5-Omni-7B 提高了副语言理解、推理和回复质量。与 CoT-SFT 基线相比,LoopSLM 的推理准确性提高了 20 多点,同时生成的词元减少64.5%,延迟降至一半。在大多数同理心回复指标上,它的性能也优于 Qwen3-Omni-Thinking,延迟降低了 34 倍。尽管仅对对话数据进行训练,但 LoopSLM 提高了一般音频基准的准确性。