论文

TS-Mask VLA:具有有效桥接的视觉-语言-动作模型的 2D 时空掩蔽

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

模型架构混合架构

摘要

视觉-语言-动作(VLA)模型旨在理解自然语言指令和视觉观察,并作为具体代理生成和执行相应的动作。最近,基于词元的自回归动作生成推动了许多代表性 VLA 模型的发展。然而,这种范式通常将动作生成简化为下一个词元预测,从而缺乏对动作序列时空结构的显式建模以及视觉语言表示和动作之间的解开,这可能会限制长期和复杂场景中的性能。在本文中,我们提出了 TS-Mask VLA,一种用于机器人操作的视觉-语言-动作框架。 TS-Mask VLA 基于两个关键设计:(1)配备 Bridge Attention 调节桥的 Discrete Diffusion Action Expert,可实现 VLM 的多层调节,并有利于更准确、稳定的动作生成; (2) 针对离散动作标记的时空 2D 屏蔽策略,增强模型对跨时间依赖性和维度间耦合的理解,从而产生结构上更加一致的动作序列。我们对模拟基准和实际任务进行了广泛的实验。在 LIBERO 上,TS-Mask VLA 仅用 0.5B 参数就实现了 95.7% 的平均成功率,性能明显优于更大的模型。在CALVIN上,它获得了最好的平均序列长度4.19和强大的长视野性能。综合分析和消融进一步验证了我们设计的有效性。