论文

说话、渲染、行动:将社交手势和数字面部与对话人形机器人的同步语音相集成

Talk, Render, Act: Integrating Social Gesture and Digital Face with Synchronized Speech for Conversational Humanoid Robot

摘要

富有表现力的人形交互需要语音、面部动画和身体姿势来形成连贯的响应。然而,许多全身人形机器人在没有视觉表现力的面部的情况下产生语音和手势,而说话的面部动画和机器人手势生成通常是分开开发的。我们提出了 Talk、Render、Act (TRABot),这是一个基于智能体的框架,包含用于运动原子构建、对话生成、运动规划和面部动画的专用智能体。首先,为了产生自然且语义上有意义的手势,我们通过将长格式、G1 重定向的 BEAT2 运动分割成具有自然手势边界、经人类验证的交流功能和可行轨迹的单元来构建机器人就绪的语义运动原子。其次,为了保持语义顺序并协调身体运动与口头响应,我们引入了语义条件组合规划器。给定有序的语义功能序列和估计的响应持续时间,规划器选择批准的原子来实现最长的可行动作序列,同时考虑转换和中性恢复。最后,我们在物理 G1 人形机器人上部署流式面部-语音-身体集成系统,将流式对话音频、音频驱动的面部动画和语义规划的身体运动结合在统一的实时交互循环中。定量和定性实验表明,TRAbot 在所有比较条件中在自然度、表现力和多模态连贯性方面实现了最佳的整体性能。

说话、渲染、行动:将社交手势和数字面部与对话人形机器人的同步语音相集成的原论文方法或结果图
图 1:TRABot 概述。离线运动原子构建智能体将 G1 重定向的 BEAT2 运动转换为经过批准的机器人就绪语义运动原子目录。对话智能体在线生成流式回复音频和语义运动请求。运动规划智能体组成批准的原子并构造依赖于状态的转换,而面部动画智能体从同一音频流生成面部帧。流式面部-语音-身体集成系统同时执行语音、面部动画和机器人身体运动。