论文

PGN:基于盘古多模态基座模型的视觉语言导航系统设计与实现

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

摘要

视觉语言导航(VLN)要求具身智能体理解自然语言指令,并从时间有序的视觉观测中预测动作。把多模态大模型适配到VLN需要视觉—语言对齐、紧凑的时序输入、动作空间落地与目标硬件上的稳定训练。本技术报告提出PGN(Pangu Navigator),一个基于OpenPangu-7B构建的离线VLN动作预测系统。训练分两阶段:第一阶段PGMM经训练Q-Former与两层MLP投影器,把冻结的EVA-ViT-G/14视觉编码器与冻结的语言底座对齐;第二阶段PGN用五观测窗口、随轮次的时序采样与“先推理后动作”的输出格式,把对齐后的模型适配到专家导航轨迹——该阶段冻结对齐的视觉通路,仅更新三个结构token嵌入与LoRA适配器。实现结合混合精度计算、选择性FP32计算与DeepSpeed ZeRO-2,运行在八张昇腾910B NPU上。在500条留出专家轨迹的教师强制开环评估下,V9报告62.29%的归一化动作匹配(NAM)与100.00%的非空率(NER)。这些指标量化的是离线专家动作对齐而非闭环导航成功;评估误差累积、路径效率与目标完成仍属后续工作。

PGN:基于盘古多模态基座模型的视觉语言导航系统设计与实现:论文配图
图 1:PGN 系统拓扑。五个按时间顺序排列的观察结果通过共享的 EVA-ViT-G、Q-Former 和多模态 MLP 路径。它们的视觉标记与 OpenPangu-7B 嵌入空间中的标记化导航指令组装在一起,并由多模态融合层进行处理。