论文

通过渐进压缩对口语模型进行高效模态链推理

Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models

模型推理推理策略与问题分解

摘要

口语模型(SLM)可以实现自然的人机交互,但其推理能力仍然落后于基于文本的 大语言模型,特别是在口语数学问答任务上。一个重要原因是 SLM 对纯粹语言化的数学表达式进行推理,而这些数学表达式比符号文本更难解释。然而,由于架构限制和额外的计算要求,将基于文本的推理直接转移到 SLM 并非易事。为了应对这一挑战,我们提出了高效模态链推理(ECoM Reasoning),这是第一个将压缩推理引入 SLM 的框架。通过压缩文本组件,使其共同充当语音指导和推理表示,ECoM Reasoning 提高了推理准确性,同时使用比标准模态链 (CoM) 架构更小的 词元预算,后者在语音之前生成中间文本。为了训练这种能力,我们进一步提出了渐进压缩,这是一种基于课程的策略,逐步将模型从完整形式推理训练到压缩推理。口语数学问答基准实验表明,ECoM Reasoning 比没有显式推理的标准 CoM 提高了 21% 的准确度,比具有完整推理轨迹且仅使用 40% 文本标记的 CoM 提高了 3%,这表明它在增强 SLM 推理的同时保持推理效率。