论文

开口还是沉默:多方对话中的上下文感知话轮转换

Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue

模型训练监督微调与指令调优

摘要

现有的语音AI助手把检测到的每一次停顿都当作开口说话的邀请。这在双人对话中行得通,但在多方场景——AI助手与多名说话者共同参与——中,停顿大量存在且含义模糊。在每个停顿都插话的助手会变得具有干扰性而非有用。在这项工作中,我们对上下文感知话轮转换进行形式化:在检测到的每个停顿处,给定完整对话上下文,我们的方法决定助手应当开口还是保持沉默。我们引入了一个包含超过120K条标注对话的基准,覆盖三个多方对话语料库。对八个近期大语言模型的评估发现,在零样本提示下它们在上下文感知话轮转换上一致地失败。随后我们提出一种带推理轨迹的监督微调方法,将平衡准确率最多提升23个百分点。我们的发现表明,上下文感知话轮转换并非涌现能力,必须显式训练。

开口还是沉默:多方对话中的上下文感知话轮转换:论文配图
图1:对话式AI中传统轮替(a)与上下文感知轮替(b)的对比示意。