论文

EmoPose:视觉语言模型引导的人形机器人情感感知手势生成

EmoPose: Vision-Language Model Guided Emotion-Aware Gesture Generation for Humanoid Robots

智能体系统Agent 动作执行与治理

摘要

具有社交能力的人形机器人必须通过手势和语音来传达情感和意图,但开放式交互必须成为在特定身体上既具有表现力又可执行的运动。这需要上下文社交意图的语义灵活性,同时保持确定性、感知实施例的机器人控制。我们提出了 EmoPose,这是一种视觉语言模型 (VLM) 引导的框架,它通过可执行的语义接口弥补了这一差距。给定语言、对话历史和可选的视觉上下文,VLM 选择一个有序的手势计划,其中包含交际类、库变体、强度和语音锚点。可扩展的机器人拥有的运动库定义了可用的表达词汇和 14-DoF 关节目标的来源。 Pose Studio支持自动轨迹生成、MuJoCo预览以及新库条目与VLM引导自动同步;确定性机器人端模块验证计划、构建轨迹、安排手势以及管理排队和中断。这种划分可以让交互功能针对新的社交环境进行扩展,而无需更改控制界面或将原始联合命令委托给基础模型。在 EmoPose-Bench 上,结构化 GPT-5.5 计划在 Easy 层上达到 $98.25\pm0.52\%$,总体达到 $76.50\pm0.54\%$,超过了同型号直接标签提示。进一步的测试验证了对话上下文的使用和有序的多动作组合。该系统完成了名义上的 MuJoCo 套件,并在物理 Unitree G1 上实现了所有 29 个编写的变体。四站实验室之旅展示了带有中断的表达性叙述、基于摄像机的对话和导航。