论文

HiFlow:通过流匹配进行无标记化的按比例自回归策略学习

HiFlow: Tokenization-Free Scale-Wise Autoregressive Policy Learning via Flow Matching

模型架构混合架构

摘要

从粗到细的自回归模型最近在视觉运动政策学习方面显示出了强大的前景,它将自回归方法的推理效率与基于扩散的政策的全局轨迹一致性相结合。然而,现有方法依赖于离散动作标记器,将连续动作序列映射到码本索引,这是一种继承自图像生成的设计,其中学习压缩对于高维像素数据是必要的。我们观察到机器人动作本质上是低维连续向量,这种标记化引入了不必要的量化误差和多阶段训练管道。在这项工作中,我们提出了分层流策略(HiFlow),这是一种无需标记化的从粗到细的自回归策略,直接对原始连续操作进行操作。 HiFlow 通过简单的时间池从每个动作块构建多尺度连续动作目标。具体来说,它对连续的动作窗口进行平均,以生成以更精细的时间分辨率进行细化的粗略摘要。整个模型在单个阶段进行端到端训练,无需单独的分词器。 MimicGen、RoboTwin 2.0 和现实环境中的实验表明,HiFlow 始终优于现有方法,包括基于扩散和基于标记化的自回归策略。