论文
GazeVLA:学习机器人操作的人类意图
GazeVLA: Learning Human Intention for Robotic Manipulation
摘要
实体化基础模型在机器人操作方面取得了重大突破,但仍然严重依赖大规模机器人演示。尽管最近的工作已经探索利用人类数据来减轻这种依赖性,但由于人类和机器人之间固有的体现差距,有效提取可转移的知识仍然是一个重大挑战。我们认为,人类行为背后的意图可以作为弥合这一差距的强大中间表征。在本文中,我们介绍了一种新颖的框架,该框架可以明确地学习和转移人类意图以促进机器人操作。具体来说,我们通过凝视来模拟意图,因为它自然先于身体动作,并作为人类意图的可观察代理。我们的模型首先在大规模以自我为中心的人类数据集上进行预训练,以捕获人类意图及其与行动的协同作用,然后对一小组机器人和人类数据进行微调。在推理过程中,模型采用思想链推理范式,在执行动作之前顺序预测意图。在模拟和现实环境中、跨长期和细粒度任务以及在少数样本和鲁棒性基准下进行的广泛评估表明,我们的方法始终优于强大的基线,概括得更好,并实现了最先进的性能。项目页面:https://gazevla.github.io。