论文
ReSiReg:在语言条件机器人任务中实现空间一致的语义
ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks
摘要
视觉语言模型 (VLM) 使机器人能够遵循开放语言指令。然而,密集的 VLM 嵌入存在噪声并且缺乏空间一致性。这对于需要同时对语义和 3D 空间进行推理的机器人应用来说是个问题。我们检查了最近的 VLM 的空间结构,并提出了 ReSiReg,这是一种特征重建方法,它使用空间一致的 VLM 中间体来改进基于语言的密集检索。 ReSiReg 将中间体聚类为视觉原型,导出它们的语言描述符,并将每个补丁重建为原型级语言嵌入的软混合。我们对跨主干网的 OVSS 和 3D 映射进行定量评估,并在现实世界的操作场景中进行定性评估。定量结果显示密集检索得到改善;操纵场景显示出空间上更加一致的目标激活。我们还为机器人应用提供紧凑的 25M 密集 VLM,其尺寸大大小于 ViT-B 基线,并且与 ViT-B 基线具有竞争力。可在 https://resireg.github.io 获取