论文
全双工语音模型的情绪控制取决于表征几何而非标签
Steering Follows Geometry, Not Labels: Emotion Directions in a Full-Duplex Speech Model
摘要
全双工语音Agent需要在实时对话过程中调节情绪和表达方式,以缓和投诉、紧急调度、软化临床结果。通过提示条件合成、参考条件合成和激活控制,对 TTS 和回合模型的情感和传递控制进行了深入研究; PersonaPlex 控制双工模型中的身份,但不影响。我们在 Moshi(一种完全开源的全双工语音语言模型)中研究情感引导,涵盖四种情感,使用均值差激活引导,每帧仅需要少量向量添加,并且无需重新训练。我们表明,情感可以从 Moshi 的残差流中线性解码,但激活控制只能部分实现,而且效果不均匀;快乐、愤怒和惊讶会朝着共同的方向发展,而悲伤则是明显可控的。我们还表明,三种情绪的共同成分不能简单地从所有情绪中平均地投射出来。