论文

Cocktail-Talker:用回合动作GRPO建模嘈杂社交环境中的多人语音对话

Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO

模型训练强化学习

摘要

语音对话系统通常设计用于干净的二元交互,其中单个用户和助手轮流说话。然而,现实世界的社交对话往往更加模糊:多个说话者可能在不相关的语音和背景噪音中参与同一个对话。每句话可能是针对助理的,针对另一位发言者的,或者完全不相关。在这种情况下,助理不仅必须决定说什么,还必须决定是否说话。在本文中,我们介绍了 Cocktail-Talker,这是一种语音 LLM 框架,用于在嘈杂的社交环境中进行多说话人口语对话建模。我们使用三个动作标记来模拟助理的行为:<|respond|>、<|listen|> 和 <|ignore|>,放置在响应或沉默之前。 Cocktail-Talker 通过监督微调和强化学习进行训练,以生成适当的动作标记,并且仅在 <|respond|> 模式下生成语音响应。为了准备训练数据,我们开发了 Cocktail-DialogGen,这是一个基于 LLM 的数据管道,可模拟跨不同社交环境中的演讲者角色的真实多演讲者对话。这些组件共同朝着在复杂的社交环境中更自然、更有选择性地交互的语音对话系统迈出了一步。