论文
哪种语音表示更符合文本本机推理?语音文本对齐对帧率和表示的研究
Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation
摘要
口语对话模型通常从文本 LLM 主干开始,但当以语音而不是文本为条件时,推理通常会降低。我们将这种模态差距的部分原因归因于时间粒度不匹配:语音标记在时间上是冗余的,并且在匹配语义下比文本长得多,稀释了每个标记的语义密度并削弱了文本本机推理动态。我们将语音词元设计作为表示选择问题进行研究,并在具有固定信息速率的冻结 LLM 主干下扫描帧速率。为了使低帧速率可行,我们引入了因式分解 FSQ 和轻量级非自回归音频 LM 头,将容量扩展到近 300 位/帧,而不牺牲高效预测。消除瓶颈后,我们扫描帧速率 (50$\rightarrow$2.08\,Hz) 和对齐深度,并在 4.17\,Hz 下观察到具有中间层表示对齐的语音 QA 一致的最佳机制。