论文
提升规划和控制的具体世界模型
Lifting Embodied World Models for Planning and Control
摘要
具身主体的世界模型根据主体所采取的行动来预测未来的观察结果。对于复杂的实施例,动作空间是高维的并且难以指定:例如,精确控制人类代理需要指定每个关节的运动。这使得世界模型难以控制,而且规划成本高昂,因为 CEM 等基于搜索的方法在动作维度上的扩展性很差。为了解决这个问题,我们训练了一种轻量级策略,将高级操作映射到低级联合操作序列。将此策略与冻结的世界模型结合起来会产生一个提升的世界模型,该模型可以通过单个高级操作预测一系列未来观察结果。我们将这个框架实例化为类人实施例,将高级动作空间定义为当前观察帧上注释的一小组 2D 路径点,每个路径点指定叶关节(骨盆、头部、手)的近期目标位置。航路点是低维的、视觉上可解释的,并且易于手动指定或搜索。我们表明,提升后的世界模型大大优于直接在低级关节空间中进行搜索(目标姿态的平均关节误差降低了 3.8 倍),同时保持更高的计算效率并泛化到策略未见的环境。