论文
基于流的通用机器人策略的不确定性量化
Uncertainty Quantification for Flow-Based Generalist Robot Policies
摘要
通用机器人策略,例如视觉语言动作模型(VLA)和世界动作模型(WAM),将强大的预训练主干与通过大规模机器人数据集上的流匹配训练的表达生成动作头相结合。尽管它们在机器人操纵方面具有很强的经验表现,但这些政策缺乏量化其预测信心并检测其行为何时可能不可靠的机制。这对非固定环境中的实际部署提出了一个关键限制,在这种环境中,模型不可避免地会遇到预训练分布之外的场景,并且可能会在没有警告的情况下失败。为了解决这个问题,我们通过利用小型系综上的速度场不一致(VFD),得出了一种有效的方法来量化流匹配模型中的认知不确定性。我们成功地使用这种不确定性估计来检测部署期间的故障以及基于流的通才策略的活动 微调。对于后者,我们提出了 SAVE,这是一种用于不确定性引导的主动多任务 微调 的简单而有效的方法,可以减少将通才策略适应新任务所需的昂贵的专家演示的数量。我们在模拟和现实世界中跨 VLA 和 WAM 进行实验。 VFD 可以更好地校准预测下游性能的不确定性估计,并以比现有方法高 8 个百分点的总体准确度检测故障。在三个现实世界的任务中,SAVE 在固定的演示预算下将最终平均成功率从 39% 提高到 47%。我们的结果表明,使用 VFD 测量认知不确定性可以增强故障意识和通用机器人策略的适应性。项目网站:tum-lsy.github.io/uq_generalist_policies。