论文
释放无限运动:通过生成视频先验缩放富有表现力的四足运动
Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors
摘要
四足机器人已经实现了非凡的运动能力,但它们的行为能力仍然局限于少数几种步态——与人们长期以来所设想的富有表现力、同伴般的存在相去甚远。导入大规模运动数据的人形配方的尝试继承了一个默认假设:机器人运动必须首先穿过动物身体,使得数据收集依赖于合作动物,跨物种重建脆弱,并且在不兼容的形态中重新定位不适定。我们提出了 Uni-Mo,一种完全自动化的管道,通过将数据稀缺性重新定义为生成问题,将动物从循环中移除:LLM 提出运动提示,视频扩散模型综合相应的机器人行为,生成的视频被提升到 3D 参考轨迹,用于训练部署在真正的 Unitree Go2 上的跟踪策略。为了使天真漂移的世代能够可靠地提取,我们引入了身份一致性损失,以强制跨帧的外观一致性。我们在 https://github.com/Amap-Robotics/Quad-Imaginarium 发布了 Quad-Imaginarium,这是一个开源数据集,包含 7,488 个语言注释的四足动物动作(18.5 小时),涵盖杂技和表演行为。我们在真实的 Unitree Go2 上验证了 392 个随机采样的运动,部署成功率为 96.7%,模拟中整个数据集的成功率为 97.6%。