论文

全双工语音模型在被要求时发言,而不是在需要时发言

Full-Duplex Speech Models Take the Floor When Asked, Not When Needed

模型评测模型能力评测

摘要

全双工语音模型可以同时听和说,保证永远在线的助手。但他们还必须决定何时发言。人类听众会在讲话时或讲话者停止时讲话,但也会自行选择纠正错误的说法、补充遗漏的单词或警告危险。我们询问全双工模型是否也具有同样的功能。为了将说话的原因与机会分开,我们构建了与上下文匹配的英语独白,其中只有触发话语在主题内变化,根据轮次分配规则定义 10 个条件,并压缩词间停顿以限制沉默产生的机会。在五个模型家庭中,被解决和沉默是比虚假事实或危险更可靠的触发因素。当触发结束后的前 2 秒内进行平均时,Moshi 和 PersonaPlex 中虚假事实的帧级文本标记概率低于中性的。暂停或允许打断也无法弥补这一差距。考虑到下限,Moshi 和 PersonaPlex 回答了最直接的问题,但质疑该主张的非空虚假事实回复的比例仅为 0.14--.15,警告危险的危险回复的比例为 0.04--.07。因此,本文确定了语音发起和响应内容之间的差距。关闭它需要真正的内容理解和基于它的干预决策。