论文
OctoSense:多模态机器人感知的自监督学习
OctoSense: Self-Supervised Learning for Multimodal Robot Perception
摘要
我们推出了 OctoSense,这是一个开源传感器平台,配备立体 RGB 和事件相机、LiDAR、热像仪、惯性测量单元、RTK 校正全球定位系统和本体感觉(来自汽车的 CAN 总线数据和四足机器人的关节角度)。同名的 OctoSense 数据集包含一天中不同时间不同类型环境下的 59 小时时间同步驾驶数据,包括传感器严重退化的情况。我们使用此类真实世界的机器人数据演示了多模式自监督学习,其中传感器具有不同的表示、频率、延迟和噪声。我们的方法是“后期融合”掩码自动编码器,(i)使用特定于模态的标记器来解释这些传感器的不同时空特征,以及(ii)在推理时缓存特定于模态的标记,以在新测量到来时对其进行处理。该架构 (i) 速度快(在 NVIDIA 5090 和 Orin NX 上计算表示的时间分别为 6.68 毫秒和 112 毫秒),(ii) 在光流估计、深度、语义分割和自我运动(平移、旋转和转向角度)等任务上比现有的纯图像基础模型表现更好,(iii) 在夜间或感知数据退化的情况下进行稳健预测。请参阅我们的项目页面,获取数据集、代码和补充视频的链接:https://abisulco.com/octosense/。