论文
TEMPO:学习动态机器人操作的时间上下文
TEMPO: Learning Temporal Context for Dynamic Robot Manipulation
摘要
视觉-语言-动作(VLA)模型在准静态操作中取得了令人印象深刻的性能,但在动态操作任务中却表现不佳,因为它们在推理时对单个观察进行操作。我们发现了造成这种限制的两个代表性失败。第一个是运动模糊性,其中单个观察不包括场景动态,因此无法预测移动物体的未来状态。第二个是状态混叠,其中任务中不同点的视觉上相似的观察需要不同的操作。我们认为,无论模型规模和推理延迟如何,这些失败都会持续存在,这表明瓶颈在于缺少时间上下文而不是模型容量。基于这一见解,我们提出了 TEMPO,它通过两个时间输入增强了预训练的 VLA:从冻结视频基础模型中提取的运动摘要以解决运动模糊性,以及紧凑的本体感受历史以解决状态混叠问题。 TEMPO 不需要对主干网进行修改,并且在训练或部署时增加最少的计算开销。在四个动态操作任务中,它将 Bottle Handover 成功率从 44% 提高到 74%,并且是解决状态混叠的唯一方法。探测和消融研究证实,每个时间信号独立地解决其相应的故障。我们进一步发布了 TEMPO-Bench,这是一个包含超过 50k 个注释帧的基准,用于评估回归和多项选择格式的运动感知机器人感知。项目网站:https://tempo-robot.github.io/