论文
动作表示中的方向尺度分解:重新思考视觉-语言-动作模型的标记化内容
Direction-Scale Decomposition in Action Representation: Rethinking What to Tokenize for Vision-Language-Action Models
摘要
动作表征在离散标记视觉语言动作(VLA)学习中发挥着核心作用,但仍未被充分研究。在传统的姿势增量表示下,动作标记对执行速度和特定于数据集的标准化很敏感,可能会模糊演示和数据集中共享的几何结构。我们引入方向尺度分解(DSD),这是一种动作表示,可在标记化之前将平移和旋转增量分解为方向和尺度分量。 DSD 隔离运动方向,同时在单独的比例通道中保留幅度。我们在单数据集和混合数据集训练下的模拟和现实操作中使用统一分箱 (BIN) 和 BEAST(基于 B 样条的分词器)评估 DSD。在 LIBERO 上,DSD 提高了两种分词器的平均成功率。在 SimplerEnv 上,混合数据集训练下 DSD-BIN 的总体成功率比 BIN 高出 10.3 个百分点。真实的机器人实验进一步显示了有或没有机器人预训练的收益。这些结果支持 DSD 作为离散词元 VLA 模型的有效动作表示,并表明它在大型且多样化的数据集混合训练时具有减轻性能下降的潜力。我们的项目页面包含其他资源,可通过此 https URL 获取