论文

ActiveScale:跨模型、数据和硬件扩展机器人的主动感知

ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware

摘要

当固定视点导致任务相关信息被遮挡或无法观察到时,主动感知对于机器人操作至关重要。然而,使视觉-语言-动作(VLA)模型能够对不断变化的观点进行推理并主动获取信息丰富的观察结果仍然具有挑战性。我们提出了 ActiveScale,这是一个通过协调模型、数据和硬件设计来推进主动感知的框架。我们的模型通过历史视频观察和明确的相机姿势监督增强了 VLA,使用每帧姿势标记和轻量级预测头来关联跨视点的观察结果并支持对场景的连贯理解。为了从人类活动中自然存在的相机运动中学习,我们引入了一种可扩展的人机中间训练方法,使用 1000 小时的自我中心和机器人数据,使模型适应时间输入和姿势监督。我们进一步介绍主动感知移动操纵平台(AMP),这是一个机器人平台,通过单操作员远程操作支持主动感知和移动操纵,从而实现可协调视点变化和操纵的可扩展演示集合。实验证明主动感知任务的成功率有所提高,而消融研究验证了相机姿势感知建模和以自我为中心的中期训练的贡献。这些组件共同为研究和开发机器人操纵中的主动感知提供了综合基础。