论文

通过野外视频的可扩展学习揭示具体城市导航中的长尾

Exposing the Long-tail in Embodied Urban Navigation via Scalable Learning from In-the-Wild Videos

模型训练合成数据

摘要

从现实世界的数据中学习具体的城市导航政策受到特定任务数据收集成本和罕见但安全关键场景的有限覆盖的限制。为了应对这些挑战,我们提出了一个可扩展的框架,用于从网络规模的野外自我中心视频中学习点目标城市导航,同时系统地暴露其长尾。该框架自动使用度量轨迹和结构化导航语义来注释未经整理的网络视频,然后将其用于训练视觉-语言-动作策略以进行可解释的导航规划。我们根据模型性能和感知运动模式的分布来描述长尾特征,并采用基于反射的分析来诊断重复出现的故障模式。对网络视频数据和现实城市导航任务的实验证明了来自无约束视频的有效知识转移,并揭示了超越聚合导航性能的连贯长尾结构。