论文

ChainVLA:通过统一执行状态链接视觉-语言-动作查询以进行长视野操作

ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

智能体系统Agent 架构与控制循环

摘要

人类通过保留对早期行动已建立的知识的同时不断调整正在进行的运动来进行长期操纵。相比之下,动作分块的视觉语言动作(VLA)策略根据每个查询的当前输入重复重新规划。现有方法通过记忆保留长期任务证据,或通过动作重用和集成保留短期运动,从而导致跨查询切换不完整。我们引入了 ChainVLA,这是一种 1.2B 参数的 VLA 策略,它通过联合且可修改的执行状态来链接连续的查询。进度上下文将循环工作状态与稀疏事件内存相结合,以承载观察衍生的任务进度,而运动尾部将先前预测的未执行延续馈送到状态构建和动作生成中。这两个组件一起调节解码器,该解码器在最新观察下重新生成每个动作范围,从而允许携带状态指导下一个预测而不修复它。 ChainVLA 在 RMBench 上的平均成功率达到 62.8%,在四个 LIBERO 套件上达到 98.8%,而删除 Motion Tail 或 Progress Context 则将 RMBench 的成功率分别降低至 11.2% 和 3.0%。这些不对称消融与运动连续性一致,有助于保留从中推断任务进度的观察流。