论文
ExoActor:外心视频生成作为通用的交互式人形控制
ExoActor: Exocentric Video Generation as Generalizable Interactive Humanoid Control
摘要
近年来,人形控制系统取得了重大进展,但对机器人、其周围环境和任务相关对象之间流畅的交互丰富行为进行建模仍然是一个基本挑战。这一困难源于需要联合捕获大规模的空间上下文、时间动态、机器人动作和任务意图,这与传统的监督不太匹配。我们提出了 ExoActor,这是一种利用大规模视频生成模型的泛化能力来解决这个问题的新颖框架。 ExoActor 的关键见解是使用第三人称视频生成作为交互动态建模的统一界面。给定任务指令和场景上下文,ExoActor 综合合理的执行过程,隐式编码机器人、环境和物体之间的协调交互。然后,此类视频输出通过估计人体运动的管道转换为可执行的人形行为,并通过通用运动控制器执行它,从而产生任务条件行为序列。为了验证所提出的框架,我们将其实现为端到端系统,并在无需额外收集实际数据的情况下演示其对新场景的泛化。此外,我们最后讨论了当前实现的局限性,并概述了未来研究的有希望的方向,说明了 ExoActor 如何提供一种可扩展的方法来建模交互丰富的人形行为,可能为生成模型开辟一条新途径,以推进通用人形智能。