论文
DFM-VLA:通过离散流匹配进行机器人操作的迭代动作细化
DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching
摘要
使用离散标记化方案对动作进行编码的视觉-语言-动作(VLA)模型已广泛用于机器人操作,但现有的解码范例仍然受到根本限制。无论动作是通过自回归 VLA 顺序解码还是通过离散扩散 VLA 并行解码,一旦生成词元,它通常是固定的并且不能在后续迭代中修改。因此,早期的词元错误以后无法有效纠正。我们提出了 DFM-VLA,一种与 VLA 匹配的离散流,可迭代地细化动作标记。 DFM-VLA 对 词元级 概率速度场进行建模,该场在细化迭代中动态更新完整的动作序列。我们研究了两种构建速度场的方法:辅助速度头公式和嵌入引导公式。为了进一步提高预测准确性,我们引入了针对 DFM 从粗到细的性质量身定制的度量对齐动作分词器 (MAAT) 以及两阶段解码策略。对 CALVIN、LIBERO、LIBERO-Plus 和现实世界操作任务的大量实验证明了我们方法的有效性。我们的项目位于 https://chris1220313648.github.io/DFM-VLA/。