论文

UniTrackPLA:用于指令引导导航和动态人员跟踪的统一全景-语言-动作模型

UniTrackPLA: Unified Panorama-Language-Action Model for Instruction-Guided Navigation and Dynamic Person Tracking

摘要

通用实体机器人应支持向语言指定目的地的导航以及在任意初始目标方位角下的动态人员跟踪。然而,现有方法通常依赖于前向观察,并通过单独的策略来处理这些任务,限制了全向感知和统一的闭环控制。我们推出了 UniTrackPLA,这是一种统一的全景语言动作模型,用于指令引导导航和动态人员跟踪。其全景感知编码 (PAE) 保留了从每个全景投影的透视图的时间和方位角结构,使透视预训练的视觉编码器能够处理全向观察。共享视觉语言主干在全景上下文中提供指令,并为这两项任务预测连续的以机器人为中心的路径点块。世界动作一致性(WAC)进一步预测以动作为条件的未来视觉状态,并在线验证路径点前缀,允许重复使用可靠的动作,同时在不一致时触发重新规划。我们还推出了 OmniTrackNav-Bench,包含 5,000 条模拟跟踪轨迹、10,000 条模拟 VLN 路线和 96 条经过验证的真实路线,提供 919,978 个航点监控实例。 UniTrackPLA 将整体跟踪 SR 从 23.50% 提高到 35.00%,将 Omni-VLN SR/SPL 从 13.00%/12.77% 提高到 19.75%/19.29%。纳入 76 条现实世界路线进一步将保留的 EP@0.2m 从 42.92% 提高到 92.08%。 Go2-W 机器人的闭环实验展示了室内外环境中的统一全景跟踪和导航。项目页面位于https://tw5775.github.io/UniTrackPLA.