论文

TaskAnchor:反应式 VLA 中的任务状态基础,用于长视野操作

TaskAnchor: Grounding Task State in Reactive VLAs for Long-Horizon Manipulation

上下文与知识上下文工程

摘要

当视觉上相似的观察可以根据任务阶段或交互历史对应于不同的动作时,反应性视觉-语言-动作(VLA)模型难以进行长视野操作。我们将这种歧义称为任务状态别名,并引入了 TaskAnchor,这是一个轻量级适配器,可在执行历史记录中提供预训练的 VLA。 TaskAnchor 将历史条件的视觉细化与里程碑监督的任务状态坐标(代表执行语义阶段的标量)结合起来。这些信号分别通过本机视觉和语言界面注入,无需引入显式规划器或修改动作生成机制。在 RMBench 上,TaskAnchor 的平均成功率约为已发布的 $\pi_{0.5}$ 和 X-VLA 基线的 4.9--5.5$\times$,并且在 RoboMemArena 和真实机器人上具有一致的增益。对于 $\pi_{0.5}$,每个操作块增加的延迟仅为 2.08\,ms。