论文
RADIO-ViPE:动态环境中开放词汇语义 SLAM 的在线紧耦合多模态融合
RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments
摘要
我们推出了 RADIO-ViPE(将所有域简化为一个——视频姿势引擎),这是一种在线语义 SLAM 系统,可实现几何感知的开放词汇基础,将任意自然语言查询与动态环境中的本地 3D 区域和对象相关联。与需要校准、姿势 RGB-D 输入的现有方法不同,RADIO-ViPE 直接在原始单目 RGB 视频流上运行,不需要事先的相机内部函数、深度传感器或姿势初始化。该系统将源自凝聚基础模型(例如 RADIO)的多模态嵌入(跨越视觉和语言)与几何场景信息紧密耦合在一起。这种耦合发生在初始化、优化和因子图连接中,以提高多种模式图的一致性。该优化包含在自适应鲁棒内核中,旨在处理主动移动的物体和代理移位的场景元素(例如,在以自我为中心的会话期间重新排列的家具)。实验表明,RADIO-ViPE 在动态 TUM-RGBD 基准上取得了最先进的结果,同时保持了与依赖校准数据和静态场景假设的离线开放词汇方法相比的竞争性能。 RADIO-ViPE 弥补了现实世界部署中的关键差距,为自主机器人和不受约束的野外视频流提供了强大的开放词汇语义基础。项目页面:https://be2rlab.github.io/radio_vipe