论文

控制可流式全双工模型中的反向通道

Controlling Backchannels in Streamable Full-duplex Models

模型推理解码与生成控制

摘要

反向通道,即对方仍在说话时产生的简短确认,例如“嗯哼”,是自然对话的核心,但全双工口语对话模型很少明确地模拟它们。我们引入了一个轻量级的反向通道头,它可以根据全双工模型自身的隐藏状态来预测反向通道何时开始。一旦该概率超过可调阈值,反向通道就会被强制解码。它附加到 7B (PersonaPlex) 和 1B (F-Actor) 模型,可以跨规模进行推广。探测证实隐藏状态可以预测真实的人类时间,并且生成评估显示出更频繁、时间更好的反向通道。人类评估者对由此产生的反向渠道的判断与真实渠道的水平相当。