论文

SeeQ:训练长视野机器人操作的通才价值函数

SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

模型训练强化学习

摘要

尽管取得了快速进展,但通用机器人政策在复杂、长期的任务上仍然很脆弱,这些任务包括多个阶段,或者需要在同一基础阶段进行反复尝试和深思熟虑才能成功。 Q 值函数可以通过对候选操作进行排名或指导策略改进来改进这些策略,但从稀疏的任务级奖励中学习需要较长的信用分配范围、困难的贝尔曼备份和广泛的数据覆盖要求。我们引入了 SeeQ(子任务引发的 Q 函数),它学习当前活动子任务的 Q 值。这缩短了价值预测范围,并实现了具有时间差异 (TD) 目标的有效学习。在训练期间,离线机器人数据中存在的子任务级注释提供分解,并能够从广泛的、可能次优的机器人数据集中进行学习。为了消除测试时对人工注释或模块化子任务预测系统的需求,我们的 Q 函数架构经过训练,可以在估计其值之前以自然语言自回归预测活动子任务。我们使用基本视觉语言主干实例化 SeeQ,在各种开源机器人操作数据上对其进行预训练,并在下游任务上对其进行微调。在两个双手机器人平台上的四个现实世界操纵任务中,SeeQ 价值函数极大地改进了 N 中最佳策略指导。