论文
TOAST:自回归视觉语言动作模型的随机机器人动作标记化
TOAST: Stochastic Robot Action Tokenization for Autoregressive Vision-Language-Action Models
摘要
自回归视觉-语言-动作模型通常将连续的机器人动作表示为离散的词元序列,从而能够使用标准的下一个词元目标进行动作预测。 FAST 通过将包含不同时间频率的动作紧凑地编码为相对较少的标记,显着改进了这种表示。然而,虽然这种压缩减少了自回归预测所需的动作标记的数量,但它并不一定会提高从有限演示中学习策略的效率。特别是,FAST 通常为每个量化动作序列分配单个确定性标记,尽管多个标记序列可以表示和解码相同的机器人运动。我们研究利用这种表征冗余是否可以改善策略学习。在本文中,我们提出了使用随机采样(TOAST)的动作序列标记化,这是一种随机动作标记化方法,可在策略训练期间对相同量化动作序列的替代标记化进行采样。这使离散监督多样化,同时保留底层机器人动作,并且不需要额外的演示。 LIBERO 上的实验表明,TOAST 相对于其确定性对应物持续改进,并且改进随着训练数据的减少而增加,当只有 1/16 的训练数据可用时,成功率提高了 6.8 个百分点。在四个真实机器人操作任务中,TOAST 比确定性对应任务进一步将平均成功率提高了 15.8 个百分点。这些结果证明了随机动作标记化对于自回归机器人策略学习的有效性,特别是在训练数据有限的情况下。