论文

LexiconVLA:学习用于未见任务的可重用原子操作代码本

LexiconVLA: Learning Reusable Atomic Action Codebooks for Unseen Tasks

摘要

视觉-语言-动作(VLA)模型很难在看不见的任务中重用重复的交互。我们的诊断研究表明,可靠的任务完成并不意味着跨任务上下文一致地执行组成原子操作。我们提出了 LexiconVLA,一个可检索的原子动作词典,用于跨任务重用。全局和详细码本分别捕获共享的交互结构和细粒度的执行变化,从而保留可重用的模式和执行细节。视觉原子动作对齐将视觉状态变化的轨迹重建与动作代码的视觉结果预测结合起来,为运动及其效果奠定了基础。我们在 AtomAction 数据集上通过轨迹重建和视觉对齐来学习这些密码本,该数据集包含来自 69 个任务的 57,803 个片段。规划器和场景感知适配器将新目标转换为共享策略的代码调节子任务,无需特定技能的专家或部署时参数更新。在 26 个 RLBench 任务的 5 个策略主干中,LexiconVLA 在很大程度上保持了 18 个已知任务的性能,同时提高了策略训练中的 8 个任务的成功率。使用 BridgeVLA,看不见的任务成功率从 16.67% 上升到 34.17%(+17.50 个百分点),总体成功率达到 71.08%,是已报告结果的方法中最高的。真实的机器人实验演示了逐步执行和故障恢复。