论文

使用语音活动相关预训练编码器进行社交机器人轮流的多模态语音活动投影

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

应用与实践语音交互与综合语音服务

摘要

轮流预测是参与人与人互动的社交机器人的关键要求,特别是在调解者环境中,机器人必须预测对话动态,而不仅仅是对暂停做出反应。这项工作提出了一种多模态语音活动投影 (MM-VAP) 框架,该框架将原始的纯音频 VAP 公式扩展到同步视听输入,同时保留其自我监督的未来投影目标。所提出的方法建立在最初针对语音相关任务进行优化的预训练视听骨干网的基础上,并通过低秩适应将其适应多模态轮流问题。在独立的说话人编码之后,说话人间注意力阶段对预测未来语音活动所需的关系动态进行建模。此外,还引入了语义一致性损失,以根据更高级别的对话活动模式对 256 状态输出空间进行正则化。 NoXi 和 NoXi+J 上的实验显示出相对于当前基线的改进,特别是对于一些轮流事件。对 Haru EDR 语料库的额外评估进一步支持了该方向对于面向中介的人机交互的适用性。