论文

耦合却迟到:全双工模型的即兴轮流对话

Coupled but Late: Turn-Taking Between Full-Duplex Speech Models in Unscripted Dialogue

模型评测模型行为与机制分析

摘要

全双工语音模型被训练来与人交谈,但它们越来越多地在自我对弈数据生成、智能体社会和基于模型的评估中相互交谈。在这个循环中,没有人会吸收时间错误:每个模型的轮流都是另一个模型的输入。我们询问循环进入的时间。两个 PersonaPlex-7B 实例在无脚本对话中在共享时钟上交换音频 token,并且将一个发言权转移规则应用于它们和总机。他们的时机是耦合的:在对话中重新配对扬声器会破坏它。但地板易手较晚,中位时间为 400-560 毫秒,而人类为 137 毫秒,而合作伙伴轮到的最后 120 毫秒(人类投影放置其转移的十分之一)持有其转移的 1%。延迟通道的一个方向会一对一地改变响应,并使预备阶段为空,这与感知结束后的反应性等待一致,而不是人类计时所需的话轮结束预测。