论文
VEGA:通过几何轨迹监督从野外自我中心视频中学习导航 VLA
VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision
摘要
我们介绍 VEGA,这是一种从未标记的以自我为中心的导航视频中训练导航 VisionLanguage-Action (VLA) 模型的方法。互联网规模的以自我为中心的视频提供了与导航相关的视觉观察的可扩展来源,捕捉杂乱的场景、近距离障碍物以及现实世界空间中的自然人体运动。然而,这些视频不能直接用于策略学习,因为它们不提供以机器人坐标系中的明确导航目标为条件的障碍物感知轨迹。 VEGA 通过从单目视频重建局部场景几何形状、采样导航目标(表示为文本、图像或空间路径点)并使用构造的几何形状生成障碍物感知轨迹来解决这一差距。然后使用生成的轨迹分布来训练流量匹配 VLA 导航策略。通过在训练期间专门使用几何图形,VEGA 将障碍物感知规划直接提炼为基于视觉的策略。此外,我们还推出了 VEGA-Bench,这是一个包含 25 万个场景和大约 500 万个导航目标以及场景几何图形的基准测试,旨在评估 VLA 的目标进度、避免碰撞和障碍物清除。我们的评估表明,与 VEGABench 上最强的基线相比,VEGA 实现了有竞争力的目标进展,同时减少了 33.0% 的碰撞,提高了 17.9% 的障碍间隙,同时在实际试验中成功率提高了至少 150.0%,减少了至少 66.7% 的碰撞,提高了至少 60.0% 的障碍间隙。最终,我们证明视频衍生的几何监督为训练障碍物感知导航 VLA 提供了可扩展且有效的信号。代码和基准将在发布时发布。