论文
通过递归校正、频率一致性和对比流匹配的高保真一步生成视觉运动策略
High-Fidelity One-Step Generative Visuomotor Policy via Recursive Correction, Frequency Consistency, and Contrastive Flow Matching
摘要
扩散和流量匹配等生成模型通过对多模态动作分布进行建模,具有先进的机器人视觉运动策略,但它们的多步采样或 ODE 求解会引入推理延迟。现有的一步加速方法通常将整个生成过程压缩为单个大更新,从而导致空间偏差、频率失真和模式平均。本文提出了一种高保真一步生成性视觉运动政策框架,通过三种互补机制解决这些问题。递归一致动作流 (RCAF) 使用递归校正来补偿空间截断误差,并使一步预测与精细的流动轨迹保持一致。双时间步频率一致性 (DTFC) 通过跨流时间步的自适应频谱一致性保留高频操作细节。对比流匹配 (CFM) 将纠缠的动作流与基于边缘的排斥目标分开,减少多模态操作中的模糊动作。在 RoboTwin、RoboTwin 2.0、Adroit、DexArt 和现实世界机器人平台上的实验表明,与强大的 10 步生成策略基线相比,所提出的方法实现了有竞争力或优越的性能,同时仅需要一次前向传递 (1 NFE),从而实现低延迟视觉运动控制。