论文

X-DiffVLA:用于视觉-语言-动作模型的 X-体现扩散动作头

X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models

模型架构新型架构

摘要

从跨实体数据中学习通用策略仍然是机器人技术中的一个基本挑战。尽管视觉-语言-动作 (VLA) 模型是在大型且多样化的数据集上进行预训练的,但它们通常依赖于特定于实施例的 微调 在下游任务中实现强大的性能。这一要求严重限制了它们的泛化能力并限制了执行类似任务的实施例之间的知识转移。为了克服这些限制,我们专注于具有共享机器人基础和异构末端执行器的跨实体设置,并提出了 X-DiffVLA,这是一种基于扩散的 VLA 模型,具有统一的跨实体动作头。 X-DiffVLA 可以利用扩散模型的生成优势来捕获跨体现数据集中的多样性和潜在相关性。具体来说,我们引入了实施例强制,这是一种无分类器的指导技术,可以隐式地将动作生成引导至特定于实施例的功能组件,无需显式监督即可捕获细粒度的结构细微差别。此外,形态树扩散方法旨在加强不同末端效应器之间的行为相关性,最大限度地提高异构演示的可转移性。 RoboCasa 和 Isaac Gym 的实验结果涵盖了从抓手到灵巧手的不同实施例,表明 X-DiffVLA 实现了最先进的性能,分别提高了 15.3% 和 12.5%。现实世界的评估进一步验证了所提出的框架的稳健性及其在可扩展的跨实体政策学习中的有效性。