论文
X-Tokenizer:用于视觉-语言-动作预训练的多模式动作分词器
X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining
摘要
现代视觉-语言-动作 (VLA) 模型必须将预训练的视觉-语言推理与精确的连续机器人控制联系起来。现有的动作标记器主要为了重建而离散化动作,生成保留运动几何形状的代码,但仅向主干提供弱语义监督。因此,我们将动作标记化不仅仅是压缩,而是多模态推理和可执行控制之间的语义接口学习。为此,我们引入了 X-Tokenizer,这是一种轻量级编码器-语义残差量化 (SRQ)-解码器架构,它提供了跨不同机械臂实施例的共享动作接口。其关键组件 SRQ 在残差矢量量化上施加了不对称结构:第一级使用掩蔽动作建模 (MAM) 进行训练,以形成捕获粗略运动意图的离散动作语言,而更深层次则保留面向重建的残差,保留细粒度的细节。为了进一步将动作标记与多模态语义对齐,X-Tokenizer 通过与预训练基础模型的表示空间的对比对齐以及下一帧视觉语言特征预测进行预训练。在 2.4M 轨迹(2.0B 动作帧)上进行预训练,单个冻结的 X-Tokenizer 插入混合离散连续 VLA 作为表示整形监督信号。 X-Tokenizer 实现了顶级的真实聚合和强大的 RoboTwin 2.0 模拟结果。它在多模态基础 (+13.5%) 和长视野任务 (+8.25) 方面优于 FAST,这表明动作标记器可以作为 VLA 预训练的语义接口,而不仅仅是动作压缩。