论文

RoboGesture:用于人形交互的实时语义对齐协同语音手势生成

RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction

摘要

使人形机器人能够以同步且具有语义意义的手势响应人类语音,是自然人机交互的基础。然而,这项任务面临三个关键障碍:语义丰富的数据集的稀缺、模型忽略音频提示而倾向于运动惯性的“模态日食”,以及物理安全方面的模拟与真实差距。我们提出了 RoboGesture,这是一个以机器人为中心的框架,它共同设计数据、建模和控制,为完整的交互式人机交互系统提供支持,在该系统中机器人可以实时聆听、响应和做出手势。我们首先建立了包含 300 多个手势类别的 RoboGesture 数据集,并开发了一个自动化管道来合成大规模无碰撞、机器人特定的音频运动对。我们的架构具有分层语义声学对齐器,可以直接从原始音频标记中提取多粒度的韵律和语义线索。这些提示驱动基于具有条件流匹配的扩散 Transformer 的流式条件运动生成器。为了确保高响应能力,我们引入了 Anti-Inertia CFG Masking,它通过迫使模型主动从音频模态中挖掘控制信号来防止模型陷入重复的历史模式。最后,基于 MPC 的安全过滤器可确保物理硬件上的实时、无冲突执行。在 Unitree G1 人形机器人上进行的实验表明,与最先进的基线相比,RoboGesture 可以生成更安全、更有节奏、语义上更合适的响应。