论文

Attacca:在连续状态下学习长时程具身目标控制

Attacca: Goal-Directed Control under State Continuity for Long-Horizon Embodied Agents

智能体系统Agent 环境交互

摘要

智能体的核心能力是通过一系列相互依赖的任务来完成复杂的目标。然而,这些智能体背后的现有视觉目标条件 策略 通常是在目标已经可见的孤立交互上进行评估,因此不会捕获连续长范围任务执行期间出现的条件。在这样的设置中,每个任务都从前一个任务留下的状态开始:智能体可能以不同的位置和方向结束,世界可能已被修改,下一个交互目标可能位于当前视野之外。因此,当智能体无法在当前观测中确定目标时,依赖此类 策略 的智能体可能会难以继续执行下一个任务。为了应对这一挑战,我们提出了 Atttacca,这是一种使用与执行环境解耦的目标图像在完整的搜索到交互轨迹上训练视觉目标条件 策略 的新方法。 Atttacca 使用上下文解耦的目标采样将每个演示与来自另一个世界的类兼容的蒙版目标图像配对,从而消除了直接场景和姿势对应。它通过目标掩模预测头学习密集的当前视图基础,提供超越动作模仿的辅助监督。我们进一步介绍了行为阶段调节,教导 策略 区分搜索、接近和交互阶段,并随着执行的进展调整其控制。我们在 Minecraft 中的多个短期和长期具体任务上评估了 Atttacca。我们的方法实现了 39.0-47.5% 的干净成功率,比最强基线提高了 1.7-2.4 倍。在长期任务中,它的完成率分别为 54%、30% 和 28%,提高了 7 倍。

Attacca:在连续状态下学习长时程具身目标控制:论文原图
图 2:Attacca 的 策略 架构。