论文

M2Tok:视觉-语言-动作模型的多头多码本离散动作标记化

M2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models

模型架构新型架构

摘要

最近的进展已经成功地采用自回归语言模型来处理多模态信号,例如图像和动作。由于原始动作信号是连续的,因此有效的标记化对于将高维输入映射到紧凑的离散标记以进行自回归处理至关重要。然而,现有的离散动作标记器经常遭受高重建损失,无法保留精确控制所需的细粒度动态。这种“离散化瓶颈”极大地限制了下游视觉-语言-动作(VLA)模型的性能上限。为了解决这个问题,我们提出了 ${M}^2$Tok,一种多头多码本动作分词器,旨在最小化重建错误并增强策略性能。我们的方法引入了两个关键的结构创新:(1)我们将潜在动作特征分解为多个头部,使模型能够隐式地将特定头部与不同的动作维度对齐; (2)我们为每个头分配独立的码本进行量化。通过利用多个密码本的组合性质,我们显着扩展了标记器的表征表达能力,与以前的方法相比,大大降低了重建损失。我们在 RoboTwin、Simpler-Env 和 3 个零样本现实世界任务上评估基于 ${M}^2$Tok 的 VLA。实验结果表明,我们的方法不仅实现了卓越的重建保真度,而且显着提高了 VLA 模型的成功率。全面的消融研究进一步证实了多头和多码本机制的有效性。代码可在 https://github.com/cpaaax/M2Tok 获取。