论文
全双工语音对话模型中的同步和轮流
Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models
摘要
全双工语音对话模型 (SDM) 可以同时听和说,使交互动态比回合制系统更接近人类对话。受人类交流中神经耦合的启发,我们研究了此类模型如何在交互过程中协调其内部表示。我们在受控条件下模拟预训练 \textit{Moshi} 模型的两个实例之间的全双工对话,操纵通道噪声和解码偏差。同步是使用跨时间滞后的中心核对齐 (CKA) 来测量的,而预期轮流线索是使用因果 LSTM 模型从延迟的内部激活中从说话者和听众的角度探测的。我们发现在无噪声条件下具有很强的代表性同步,峰值接近零滞后,并且随着噪声而降低,并且我们表明内部状态编码支持提前轮流预测的预期信息。