论文
NavCMPO:用于自适应导航的价值评估器引导的 MeanFlow 策略优化
NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation
摘要
基于端到端扩散的策略在无地图视觉导航中表现出了强大的性能,但其迭代去噪过程引入了大量的推理延迟,而行为克隆将性能限制为专家演示的质量。我们提出了 NavCMPO,这是一个两阶段自适应导航框架,它结合了几步 MeanFlow 轨迹生成、价值评估器引导的细化和强化学习 微调。在 预训练 期间,障碍物邻近预测任务鼓励视觉表示捕获障碍物感知的空间信息。为了补偿由少步生成引起的避障性能下降,批评家引导轨迹细化(CGTR)使用经过障碍点云监督训练的批评家的梯度来细化中间轨迹。在适应过程中,使用近端策略优化和行为克隆正则化来微调平均流策略,同时更新批评器以适应特定于实施例的观察变化。在 InternVLA-N1 基准的匹配训练预算下,NavCMPO 的平均成功率为 74.7%,比重新训练的 NavDP 基线高出 6.4 个百分点,同时将推理延迟从 85ms 减少到 60ms。 Unitree Go2 上的实验进一步证明了有效的模拟到真实的传输。