论文

DreamAvoid:关键阶段测试时的梦想,以避免 VLA 政策失败

DreamAvoid: Critical-Phase Test-Time Dreaming to Avoid Failures in VLA Policies

智能体系统Agent 规划

摘要

视觉-语言-动作 (VLA) 模型在细粒度操作中通常很脆弱,关键阶段的微小动作错误可能会迅速升级为不可恢复的故障。由于现有的 VLA 模型主要依赖于成功的演示进行训练,因此它们在这些关键阶段缺乏对失败的明确认识。为了解决这个问题,我们提出了 DreamAvoid,这是一个关键阶段测试时梦想框架,使 VLA 模型能够预测和避免失败。我们还引入了自主边界学习范式,以完善系统对成功与失败之间微妙边界的理解。具体来说,我们(1)利用梦想触发器来确定执行是否已进入关键阶段,(2)通过操作提议器从VLA中采样多个候选操作块,以及(3)使用梦想评估器,在混合数据(成功、失败和边界情况)上联合训练,以“梦想”与候选操作相对应的短期未来,评估它们的值,并选择最佳操作。我们对现实世界的操作任务和模拟基准进行广泛的评估。结果表明,DreamAvoid能够有效避免失败,从而提高整体任务成功率。在四项现实世界任务中,DreamAvoid 取得了 72.5% 的成功率,而基本策略为 48.8%,GPC-RANK 为 54.4%。我们的代码可在 https://github.com/XianzheFan/DreamAvoid 获取。