论文

用于视觉运动策略学习的有序动作词元

Ordered Action Tokens for Visuomotor Policy Learning

摘要

动作标记化将连续的机器人动作块映射到离散的标记,并已成为现代视觉运动策略的重要接口。现有方法要么依赖于产生过长标记序列的分析离散化方法,要么依赖于缺乏结构的学习潜在标记器,限制了它们与下游策略的兼容性。在这项工作中,我们确定了动作标记化的三个需求——高压缩性、完全可解码性和有序标记空间——并引入了有序动作标记化(OAT),这是一种满足所有这三个条件的学习动作标记化器。 OAT 使用带有寄存器、有限标量量化和排序诱导训练机制的 Transformer 将动作块离散化为有序的标记序列。通过训练每个词元前缀解码为有效的动作块,OAT 将粗略的控制信息放入早期词元中,并使用后来的词元来细化剩余细节,从而在推理成本和动作保真度之间随时进行权衡。我们在操作词元的两种流行用途中验证了 OAT:生成用于控制的词元的自回归策略,以及使用词元损失来塑造基于流程的动作专家所使用的视觉语言模型上下文的词元协同训练策略。 OAT 跨越三个策略主干和跨越五个模拟基准和现实世界设置的 60 多项任务,始终如一地提供强大的策略性能,同时在推理时提供显着更大的灵活性。