论文
SA-VLA:用于提高视觉-语言-动作模型性能的状态感知标记器
SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance
摘要
离散动作标记化为自回归 VLA 策略提供了一个紧凑的接口,但从离散代码中准确恢复连续的机器人动作仍然具有挑战性。现有的分词器通常将每个离散代码映射到固定的连续动作原型,忽略机器人当前的本体感受状态。这种限制在操作中尤其明显,其中相同的动作词元在不同的关节配置、物体姿势和接触条件下可能需要不同的连续控制。因此,我们提出了 SA-VLA,这是一种状态感知动作标记器,可根据机器人状态进行动作解码。我们研究了基于 VQ 的动作标记化的两种状态注入机制:状态和动作特征之间的交叉注意力,以及预测状态条件动作调制和重建的动作明智调制因子的轻量级状态适配器。适配器公式通过允许每个离散词元表示一系列依赖于状态的连续动作来扩展有限密码本的有效支持,同时保留离散动作建模的效率和兼容性。 SA-VLA 集成到基于 LLM 的 VLA 策略中,支持自回归和并行动作词元解码,对模型接口的更改最少。在 12 个 RoboTwin 操作任务中,SA-VLA 将平均成功率从最强分词器基线的 0.29 提高到 0.56。在针对三个现实世界任务的零样本模拟到真实实验中,它比最强的分词器基线进一步提高了平均成功率,从 0.15 提高到 0.33。这些结果表明,状态条件动作解码是减少离散 VLA 策略中压缩间隙的简单而有效的机制。