论文

世界—价值—动作模型:视觉语言动作系统的隐式规划

World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems

摘要

视觉-语言-动作(VLA)模型已成为构建将感知和语言转化为行动的具身Agent的有前途的范例。然而,大多数现有方法依赖于直接行动预测,缺乏对长期轨迹进行推理并评估其后果的能力,这限制了复杂决策任务的性能。在这项工作中,我们引入了世界价值行动(WAV)模型,这是一个统一的框架,可以在 VLA 系统中实现隐式规划。 WAV 模型不是执行显式轨迹优化,而是学习以视觉观察和语言指令为条件的未来轨迹的结构化潜在表示。学习的世界模型预测未来状态,而轨迹价值函数评估其长期效用。然后,动作生成被公式化为该潜在空间中的推理,其中模型逐渐将概率质量集中在高价值和动态可行的轨迹上。我们提供了一个理论视角,表明随着视野的增加,直接在行动空间中进行规划会遭受可行轨迹概率指数衰减的影响。相比之下,潜在空间推理将搜索分布重塑为可行区域,从而实现高效的长期决策。广泛的模拟和真实世界的实验表明,WAV 模型始终优于最先进的方法,在任务成功率、泛化能力和鲁棒性方面取得了显着提高,特别是在长程和组合场景中。代码可在 https://github.com/Win-commit/WAV 获取。