论文
WISE:世界模型引导的想象力调度,实现视觉-语言-动作模型的高效 后训练
WISE: World-model-guided Imagination Scheduling for Efficient Post-training of Vision-Language-Action Models
摘要
后训练 VLA 策略通常依赖于受监督的 微调 以及昂贵的专家演示或强化学习以及昂贵且可能不稳定的现实世界探索。世界模型通过想象的未来评估候选人的行为,提供了一种有希望的替代方案,但有效的 后训练 需要的不仅仅是准确的预测:想象力必须安排在有用的地方,限制在可靠的范围内,并转化为值得信赖的政策监督。在机器人操作中,想象力的价值在不同的执行阶段有很大差异,而较长的预测轨迹可能会累积预测错误并引入不可靠的学习信号。我们引入了 WISE(世界模型引导的想象力调度,用于高效的视觉-语言-行动模型 后训练),这是一个统一的框架,用于协调在政策细化过程中何时以及如何使用世界模型想象力。 WISE 有选择地在交互相关状态下调用想象力,执行有界多视图预测轨迹,使用进度和完成信号评估候选未来,并使用它们的相对结果来完善从真实交互上下文中生成的操作。使用 $π_0$ 和 $π_{0.5}$ 进行的广泛实验表明,与完全想象相比,在不同的操作任务中都取得了一致的改进,同时将 GPU 计算时间减少了约 80%。现实世界的评估进一步表明,在不同的现实世界分布变化下,鲁棒性和泛化性有了显着的提高。