论文

用于社交机器人中介的多模态语音活动预测:预期行为和部署约束

Multimodal Voice Activity Projection for Social Robot Mediation: Expected Behavior and Deployment Constraints

应用与实践语音交互与综合语音服务

摘要

轮流预测对于充当人与人互动中介者的社交机器人尤其重要,其中预期的行动通常不是说话,而是定向、等待、避免打扰或准备平衡的干预。本文提出多模态语音活动投影(MM-VAP)作为未来机器人中介行为的人类状态感知感知层。该模型根据同步的视听证据估计对话楼层的未来演变,并得出轮流事件,例如保持、移动、移动预测、反向通道预测和重叠相关状态。该方法使用 VA 相关的预训练视听编码器、LoRA 自适应、说话者间注意力以及来自未来语音活动预测的零样本事件推断。 NoXi、NoXi+J 和 Haru EDR 上的实验支持了该公式的可行性,特别是对于可以与凝视准备、积极倾听和保守干预相关的楼层管理活动。最后,本文定义了预期的机器人输出接口,并讨论了主要的部署约束,包括实时推理、预处理延迟、多模态同步和输入质量监控。