论文
Praxis:从单次第一视角示范迁移全身操作
Praxis: Distilling Physical Interaction Priors from Egocentric Videos for Generalizable Whole-Body Manipulation
摘要
移动人形操纵既需要到达可用的工作空间,又需要在对象姿势和接触条件发生变化时保持精确的手部对象交互。从有限的特定任务数据中学习这些行为仍然具有挑战性。为了弥补这一差距,我们引入了 Praxis,这是一种全身操纵框架,它将来自一次性第一视角视频演示的物理交互先验与闭环姿势校准和在线感知结合起来。该框架协调三个阶段:视觉语言引导的目标物体导航、对齐手臂工作空间的闭环姿势校准以及通过同步上半身和下半身控制进行灵巧操作。在线视觉反馈重新展示了新物体姿势和场景配置下演示的交互几何形状,而触觉反馈则使手部动作适应实际接触条件。每种操作技能均由一次人工演示指定,无需针对特定任务的操作策略进行再训练。五个长时程操作任务的实验证明了空间、视觉和跨对象泛化,以及从所有三个阶段的外部物理干扰中恢复。
