论文
世界到手腕:用于细粒度机器人操作的任务条件未来手腕建模
World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation
摘要
视觉-语言-动作(VLA)模型通常将主视图和手腕视图观察视为并行视觉输入,而忽略了它们在机器人操作中的不同作用。然而,细粒度的操作受益于预测手腕局部交互在全局任务环境下如何演变。为了解决这一限制,我们提出了 World-to-Wrist VLA (W2-VLA),这是一种用于细粒度机器人操作的 VLA 模型,具有任务条件的未来手腕建模。给定当前的多视图观察和任务指令,W2-VLA 将一组潜在建模标记上下文化为视觉语言模型和手腕预测器之间的紧凑接口。根据该界面和观察到的手腕历史记录,预测器可以预测未来的手腕潜在信息,并将其转换为用于动作预测的未来感知上下文。此外,我们还引入了 W2-CoT,这是一种合成管道,可生成描述操作进度、物理转换线索和手腕局部证据的结构化注释。这些注释提供了辅助监督,可以塑造任务条件化的潜在接口。 LIBERO、RoboTwin 2.0 和现实世界操作任务的实验表明,单臂和双手设置的细粒度和接触敏感操作得到了改进,同时保持动作生成率高于 80 Hz。