论文

When2Speak:大语言模型 多方对话中的时间参与和轮流的数据集

When2Speak: A Dataset for Temporal Participation and Turn-Taking in Multi-Party Conversations for Large Language Models

模型评测基准与评测资源

摘要

大语言模型 (LLM) 擅长生成适合上下文的响应,但对于多方对话的校准仍然很差,在多方对话中,决定何时发言与说什么内容同样重要。在这种情况下,每次都天真地做出反应会导致过度打断并降低对话的连贯性。我们引入了 When2Speak,这是一个基础合成数据集和四阶段生成管道,用于学习群体互动中的干预时机。该数据集包含超过 215,000 个示例,这些示例源自涉及 2-6 个发言者的 16,000 次对话,涵盖不同的对话风格、语气和参与者动态,并在每个回合对“说话”与“沉默”决策进行明确建模。我们的管道结合了现实世界基础、结构化增强、受控转录合成和 微调 就绪监督,并且完全开源,以支持可重复性和适应特定领域的对话规范。在多个模型系列中,When2Speak 上的监督 微调 (SFT) 显着优于零样本基线(例如,4B+ 参数模型的平均 Macro F1 增长为 60%,最大增长为 120%)。然而,SFT 训练的模型仍然系统性地过度保守,从错过干预率 (MIR) 中可以看出,错过了近一半的必要干预,该率平均为 0.50,即使在较大的模型规模下也能注意到。为了解决这个限制,我们应用了具有不对称奖励塑造的强化学习,这将 MIR 降低到 0.186-0.218,并将召回率从 0.479 增加到 0.78-0.81。我们的研究结果表明,时间参与是会话智能的一个独特且可训练的维度,并且扎根的合成数据提供了有效且可扩展的途径,使 LLM 能够更自然、更适当地参与多方交互。