论文

ActionPiece:重新思考自回归视觉-语言-动作模型的动作标记化

ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models

模型架构新型架构

摘要

动作标记器在自回归视觉语言动作(VLA)模型中发挥着核心作用,确定策略训练的目标和从预测标记恢复的可执行命令。它们的保真度通常使用均方误差 (MSE) 等逐点重建指标进行评估,但小的个体误差并不能完全表征跨演示的动作调整的忠实程度。压缩后,相似的动作可能仍然聚集在代表性动作周围,而不同上下文所需的调整则被减少、扭曲甚至逆转。我们引入物理排名一致性(PRC)来衡量标记化在重建后保留本地物理距离排名的程度。评估解码的动作提供了跨词元词汇表和解码器架构的通用参考,通过关系保真度的度量补充了逐点准确性。我们进一步提出了 ActionPiece,它通过表示学习和量化的联合监督来保留物理动作关系。物理排名保留监督编码器和量化特征距离中的近远排序,而量化正则化将相同的排序应用于码字分配分布。这两个目标都增强了重建,为标准自回归策略学习和通过冻结解码器执行生成离散动作词元。在相同的 Qwen3-VL-4B 策略训练设置下,ActionPiece 在 LIBERO 上达到 94.8%,在未见的 LIBERO-Plus 上达到 68.8%,另外的评估在 SimplerEnv 上达到 71.9%,在 VLA-Arena L0-L2 上达到 51.5%。成分消融表明,这两个目标共同提高了 PRC 和政策的成功,证明了身体关系监督对于行动标记化的价值。