论文

LEAP-NBV:面向基础模型下一最佳视角规划的轻量边缘主动感知

LEAP-NBV: Lightweight Edge Active-Perception for Foundation-Model Next-Best-View Planning

模型优化端侧模型

摘要

基础模型正赋予自主系统更强的智能,通过视觉感知实现对环境更全面的理解。一个代表性例子是人体网格恢复(HMR),它提供目标的三维姿态和形状估计,可服务于战术任务。然而此类模型的体积和功耗使其难以在边缘平台上运行并限制实时性能,削弱了战术边缘部署的要求——尤其是主动感知:移动机器人必须机载规划下一最佳视角,且在受干扰的通信下无法卸载计算。我们提出 LEAP-NBV,一个在边缘设备上运行基础模型驱动的下一最佳视角(NBV)规划的轻量主动感知框架。为此,我们将一系列大型 HMR 教师模型各蒸馏为紧凑的 32M 学生模型(使用离线网格目标),再将视觉编码器量化到 FP16,并刻画其设备上的精度与延迟。在遮挡感知的主动感知回路内,我们在同一保留基准上评估所有配置,并将端到端管线部署到 NVIDIA Jetson Xavier NX,报告实测的设备延迟和能耗。蒸馏使测试集上的 Procrustes 对齐平均每顶点位置误差(PA-MPVPE)较未蒸馏学生恢复 6-7 毫米。选择边缘最优的压缩模型使 HMR 引擎达到约 12 毫秒、精度损失很小,整个闭环以 3.6 FPS 和每帧 2.6 焦耳运行,相比未压缩模型实现 2.0 倍加速和 3.0 倍节能,同时下游任务质量几乎持平。

LEAP-NBV:面向基础模型下一最佳视角规划的轻量边缘主动感知:论文配图
图 1:LEAP-NBV 概览。(A) 压缩。ViT 主干占据 SMPLer-X HMR 网络的绝大部分(304 M 参数,占 93%);LEAP-NBV 将其蒸馏为 ViT-S 学生网络(327→32 M),并将主干与预测头量化为 FP16,SMPL-X 尾部保留 FP32。(B) 机载流水线。压缩后的模型在 Jetson Xavier NX 上以 276 ms/帧、2.58 J/帧驱动主动感知循环(检测、HMR、几何、NBV 规划),比 FP32 模型快 2.0 倍、能耗低 3.0 倍。