论文

观看、回忆、行动:并发体现流中始终在线的机器人

Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams

智能体系统Agent 架构与控制循环

摘要

永远在线的机器人面临着永不停歇的信息流:指令到达并消失,场景发生变化,它自己过去的行为重塑了它必须推理的内容。今天的行动模型是针对相反的情况而构建的:固定指令、没有中间任务干预、单步推理。在开放世界中,机器人必须观看直播以寻找遥远未来的线索,回忆自己过去的行为,并在双臂并发下对其采取行动。我们提出了 ARMS(多模式流中永远在线的机器人),这是一种故意简单的流策略:单个预训练的 $\pi$0.5 主干由三个轻量级模块增强,这些模块将实时感知、具体状态和机器人自己过去的动作转化为主干在行动之前读取的上下文。这些模块异步更新此上下文,因此观看和回忆永远不会阻止动作,并且两条手臂会同时动作。 ARMS 没有发明新的机制,而是将这些学习的上下文提供者与代理因果自历史集成在一起,记录哪个手臂在何时做了什么。为了在没有额外注释的情况下监督它们,我们构建了 ARMS 数据集,其分阶段构建脚本本身标记了来自真实双臂远程操作的每个模块。经过训练,ARMS 在综合任务上达到了 45%,而我们四个主要基线中最强的任务达到了 28%,并且消融确认了内存模块、体现状态头和异步并发都是必要的。