论文

NAVI-Orbital:首次在轨演示零样本视觉语言模型用于地球观测

NAVI-Orbital: First In-Orbit Demonstration of a Zero-Shot Vision-Language Model for Autonomous Earth Observation

AI 基础设施模型部署

摘要

随着地球观测数据生成速度超过下行链路带宽和人机交互处理速度,机载数据收集和可操作的地面情报之间的差距越来越大。本文介绍了 NAVI-Orbital,这是一个部署在近地轨道 (LEO) 航天器上的软件系统。据作者所知,2026 年 4 月 16 日,NAVI-Orbital 实现了完全在机上执行自主多模态推理的视觉语言模型的首次在轨演示。 NAVI-Orbital 使用本地视觉语言模型 (Gemma 3) 对每个捕获的场景进行分类,生成其内容及其特征之间关系的文本描述,并通过自然语言对话响应操作员的后续操作。该系统通过简单的英语提示代替传统的命令序列重新分配任务,并由基于图形的状态机(LangGraph)协调专用代理进行检测和对话。地面基准测试(7,960 幅图像策划的 AID 基准测试的准确度为 88.16%)、Flatsat 验证以及新获取的、以前未见过的地球图像的实时在轨捕获(包括未经校正的 YAM-9 图像,通过硬件加速 GPU 推理在机上处理且无需对飞行仪器进行微调)的结果证明了在卫星级边缘计算机上运行基础模型以反转传统模型的可行性通过在轨地球观测的语义压缩获取然后下行传输所有带宽配置文件。

NAVI-Orbital:首次在轨演示零样本视觉语言模型用于地球观测:论文配图
表 VI:来自 Flatsat 环境的交叉验证检测结果。每张图像都通过 NAVI-Orbital 管道进行端到端处理。 © 阁楼轨道 2026。