论文

全双工语音大语言模型中杂散起始的因果分析和缓解

Causal Analysis and Mitigation of Spurious Onsets in Full-Duplex Speech LLMs

模型推理解码与生成控制

摘要

像 Moshi 及其衍生品 PersonaPlex 这样的语音到语音大语言模型可以通过全双工生成同时听和说。然而,在用户长时间沉默期间,他们可能会开始不恰当地说话:在数字零输入下,Moshi 和 PersonaPlex 在五分钟持续时间内分别有 30% 和 27.5% 开始说话。是什么原因导致这种虚假​​言论呢?我们研究了两个假设:要么重复采样选择语音,尽管起始概率持续较低,要么对非语音输出进行自我调节导致起始概率突然激增。我们发现,在每次观察到的起始点,语音概率在一个 80 毫秒的帧中激增超过 9 个数量级,支持后一种假设。然后,为了在不阻止真实响应的情况下抑制这些起始点,我们提出一个因果反事实问题:模型是否响应用户语音,或者如果前面的用户输入被静音,其下一个词元分布是否会保持相似?因此,我们抑制了在这种干预下其分布变化很小的发作。在真实的麦克风噪声下,我们的方法抑制了虚假起始,同时保留了真实响应:Moshi 的单侧 95% 置信下限为 98.68% 和 98.82%,PersonaPlex 的单侧 95% 置信下限为 96.90% 和 99.25%。我们的推理时间方法无需重新训练即可实时运行,95% 的决策时间低于 61 毫秒,在 80 毫秒的帧预算内。我们的代码可在 https://github.com/KentoNishi/icassp27-spurious-onsets 获取。