论文

基于视觉的人形代理

Visually-grounded Humanoid Agents

智能体系统Agent 架构与控制循环

摘要

数字人类生成已经研究了数十年,并支持广泛的现实世界应用。然而,大多数现有系统都是被动激活的,依赖于特权状态或脚本控制,这限制了新环境的可扩展性。相反,我们会问:数字人类如何在新颖的场景中仅使用视觉观察和指定目标来主动表现?实现这一目标将能够在任何 3D 环境中大规模地填充数字人类,这些数字人类表现出自发、自然、目标导向的行为。为此,我们引入了基于视觉的人形代理,这是一种耦合的两层(世界代理)范例,可以在多个层面上复制人类:它们在现实世界 3D 场景中看起来、感知、推理和行为就像真实的人一样。世界层通过遮挡感知管道从现实世界视频中重建语义丰富的 3D 高斯场景,并容纳基于高斯动画的人类化身。代理层将这些化身转变为自主的人形代理,为它们配备第一人称 RGB-D 感知,使它们能够通过空间意识和迭代推理执行准确的具身规划,然后在底层上以全身动作的形式执行,以驱动它们在场景中的行为。我们进一步引入了一个基准来评估不同重建环境中的人形场景交互。实验表明,我们的智能体实现了稳健的自主行为,与消融和最先进的规划方法相比,任务成功率更高,碰撞更少。这项工作使活跃的数字人口成为可能,并推进以人为中心的具体人工智能。数据、代码和模型将开源。