论文
KINO:用于人形机器人操纵中的 VLM 规划和全身控制的关键帧接口
KINO: A Keyframe Interface for VLM Planning and Whole-Body Control in Humanoid Loco-Manipulation
摘要
人形机器人操纵要求机器人在执行协调的全身运动时解释任务指令和场景语义。我们提出了一个分层框架,使用运动关键帧作为视觉语言模型(VLM)规划和强化学习(RL)控制之间的中间表示。每个关键帧指定一个目标全身机器人姿势,以及适用时的物体姿势。给定语言指令、场景观察和执行反馈,VLM 从预定义库中选择连续的与任务相关的关键帧。选定的关键帧将重新定位到当前场景,以考虑对象的姿势和尺寸。然后,以关键帧为条件的全身策略会生成联合级别的行动来实现这些目标。我们引入了一种用于低级策略训练的基于显着性的关键帧采样策略,该策略在使用稀疏 VLM 关键帧时将端到端任务成功率从 44% 提高到 92%。我们在模拟和 Unitree G1 人形机器人上评估我们的框架的对象拾取、运输和放置任务。该系统成功地执行了单手和双手操作,并推广到训练参考数据之外的放置位置。