论文

通过激活指导克服全双工口语模型中的状态惯性

Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering

模型评测模型行为与机制分析

摘要

全双工口语模型(FD-SLM)通过允许模型同时听和说来实现无缝语音交互,但它们协调听和说的内部机制仍未得到充分探索。我们分析了 FD-SLM 隐藏表示中编码的预测行为,发现它们表现出特定于流的预测模式:在听期间,它们优先预测传入的用户流,而在说话期间,它们优先预测模型输出流。基于这一观察,我们表明 FD-SLM 在两种状态之间动态调节其内部预测焦点:与模型输出生成一致的生成状态和与传入用户输入一致的感知状态。然而,这种调制可能会滞后于对话上下文中的突然变化。在用户中断期间,模型在转换到感知状态之前仍然短暂地偏向生成状态,导致它错过输入输入的开始。我们将这种延迟的内部过渡状态称为惯性。为了量化其下游影响,我们引入了零缓冲基准(ZBB),这是一种诊断基准,用于评估用户突然开始说话时的立即中断理解。我们使用响应正确性和首词出现率 (IWOR) 来评估此设置。最后,我们通过感知向量的激活引导来减轻状态惯性,这是一种 无需训练 干预,几乎不需要额外的计算开销。在多个最先进的 FD-SLM 中,激活引导极大地改善了中断处理;例如,在 PersonaPlex 上,它在没有任何 微调 的情况下将正确性从 28% 提高到 45%,将 IWOR 从 40% 提高到 72%。