论文

VLA-Pro:视觉-语言-动作模型的跨任务程序记忆传输

VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models

摘要

视觉-语言-动作(VLA)模型在通用机器人操作方面表现出了强大的潜力,但它们仍然难以推广到需要跨对象、场景和动作模式传递相关经验的看不见的任务。本文提出了 VLA-Pro,这是一种即插即用框架,旨在通过在训练时存储与任务相关的程序记忆并在推理期间传输这些记忆来增强跨任务泛化。具体来说,VLA-Pro 在训练期间将特定于任务的 LoRA 适配器存储为参数化程序存储器。在推理时,VLA-Pro 根据当前多模态上下文检索相关的程序记忆,并动态融合这些记忆以生成当前动作块。 RoboTwin、RLBench 和现实世界操作任务的实验表明,VLA-Pro 持续改进了跨多个骨干网的跨任务泛化,在模拟方面实现了高达 207% 的相对改进,并将现实世界的成功率从 5.8% 提高到 65.0%。这些结果表明,程序性记忆检索和适应提供了一种有效的机制,可以将操作经验转移到新任务,同时保持模块化和执行稳定性。