论文

ProAct:超越重构误差的机器人动作分词器训练

Beyond Reconstruction: What Matters in Action Tokenization for Robot Policies?

模型训练模型评测应用与实践预训练模型行为与机制分析机器人

摘要

自回归动作标记策略(例如视觉语言动作模型)需要动作标记器将离散标记序列转换为连续空间中的精确控制动作。许多动作标记器通过重建目标来学习标记和动作之间的映射。然而,正如我们通过广泛分析表明的那样,足够准确的动作重建只是下游机器人策略成功的一部分。同样重要的是,该策略能够为新的观察结果预测正确的标记,并且未见过的策略标记预测仍然可以解码为合理的操作。这些属性是分词器训练的下游,并且不仅仅由重建目标直接激励。在这项工作中,我们引入了可预测和鲁棒的动作标记化(ProAct),这是一种标记器训练方法,可以战略性地增强重建,目标是提高下游的可预测性和鲁棒性。 ProAct 与策略无关,仅使用操作数据集进行训练。在 Robomimic、LIBERO 和 RoboTwin 基准测试以及各种标记器架构中,ProAct 将部署成功率平均提高了 11.3 个百分点。这些改进还转化为视觉-语言-动作策略和现实世界的机器人操作,平均收益分别为 21.8 和 36.7 个百分点。这些结果表明,有效的行动标记化应该被设计为平衡保真度、可预测性和鲁棒性的策略接口,而不是仅仅作为一个重建问题。