论文

SparkVLA:具有自适应动作分块的停止感知分层 VLA,用于长视野操作

SparkVLA: Stop-Aware Hierarchical VLA with Adaptive Action Chunking for Long-Horizon Manipulation

智能体系统Agent 架构与控制循环

摘要

在分层视觉-语言-动作(VLA)系统中的每个重新观察点,必须做出两个接口决策:何时终止当前子任务以及执行建议的动作块多远。这些决策是相互依赖的——最佳停止点取决于执行器计划做什么,而最佳执行长度取决于子任务边界所在的位置——然而现有的体系结构是孤立地评估它们的,这是两个模块都无法单独克服的不对称性。我们提出了 SparkVLA,一种停止感知的分层 VLA,它通过将两个决策制定为单个排名来解决这种相互依赖性:停止与统一候选集中的每个动作前缀长度进行竞争,系统选择得分最高的选项,消除了阈值调整,并且只需要离线序数偏好。锚条件上下文编码模块缓存历史感知子任务锚编码起始状态记忆和目标语义,指导视觉标记修剪到任务相关区域;停止感知动作前缀选择头通过在块边界上的完全自我关注来对所有候选者进行评分,以提高效率。在 RoboCerebra 上,SparkVLA 实现了 47.12% 的成功率,超出官方分层基线 30.57%,超出最强可重现方法 26.83%。多步任务的真实机器人实验进一步验证了物理硬件上的这些收益。