论文

Qwen-RobotNav 技术报告:专为代理导航系统设计的可扩展导航模型

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

摘要

代理导航系统需要一个基本导航模型,其观察策略可以在推理时从外部重新配置,因为指令跟踪、目标搜索、目标跟踪和自动驾驶共享相同的感知规划主干,但需要完全不同的策略来消耗视觉流。我们提出了 Qwen-RobotNav,这是一种基于 Qwen-RobotNav 构建的可扩展导航模型,它通过具有两个互补维度的参数化接口来解决这个问题:选择导航行为的多个任务模式,以及控制视觉历史编码方式的可控观察参数(例如,词元预算,每个摄像机的权重)。通过对所有参数进行训练时随机化,Qwen-RobotNav 对于任何需要对 Qwen-RobotNav 主干架构进行零架构修改的推理时配置都具有鲁棒性。我们在 1560 万个样本上训练 Qwen-RobotNav;与视觉语言数据的协同训练可以防止陷入仅轨迹训练中观察到的反应性动作序列映射器。参数化接口还使 Qwen-RobotNav 成为代理系统的天然构建块:对于长期场景,上层规划器将目标分解为子任务,并在中间动态切换 Qwen-RobotNav 的任务模式和上下文策略,通过对同一模型的重复调用来组合复杂的行为。大量实验表明,Qwen-RobotNav 在主要导航基准测试中创下了新的最先进结果。该模型表现出从 2B 到 8B 参数的良好扩展性,通过联合多任务训练开发了跨任务族传输的共享空间规划基底,并展示了对跨不同环境的现实世界机器人的强大的零样本泛化能力。