论文

ASH:在长远世界中自我磨练的特工

ASH: Agents that Self-Hone in Long-Horizon Worlds

智能体系统Agent 架构与控制循环

摘要

长视野视觉运动任务仍然是人工智能的一个基本挑战,因为当前的方法依赖于手工设计的奖励或带有动作标记的演示,而这两种方法都无法扩展。我们引入了 ASH,这是一种代理系统,可以从未标记的、嘈杂的互联网视频中学习长期策略,无需奖励塑造或专家注释。 ASH 遵循自我完善循环;当它陷入困境时,ASH会从自己的轨迹中学习逆动态模型(IDM),并使用其IDM从相关的互联网视频中提取监督。 ASH 使用无监督学习来识别大规模互联网视频中的关键时刻,并将其保留为长期记忆 - 使其能够解决长期问题。我们在两个需要数小时规划的互补环境中评估 ASH:Pokemon Emerald(一款回合制 RPG)和 The Legend of Zelda: The Minish Cap(一款实时动作冒险游戏)。在这两款游戏中,行为克隆、检索增强和零样本基础模型基线都处于稳定状态,而 ASH 在我们的 8 小时评估中保持进展。 ASH 在《Pokemon Emerald》中平均达到 11.2/12 个里程碑,在《塞尔达传说》中达到 9.9/12 个里程碑,而最强基线在这两种环境中分别停留在平均 9.3/12 和 7.8/12 个里程碑上。我们证明,自我改进的智能体是长期世界中学习的可扩展配方。