论文
LOCUS:用场景图更新CLIP表征寻找目标容器
LOCUS: Landmark-Oriented Container Discrimination Using Spatial Graphs
摘要
机器人越来越多地部署到非结构化真实环境,理解物体间复杂空间和语义关系仍是稳健、可泛化操作和导航的基础挑战。例如,决定到哪里寻找不可见物体,同时取决于物理可行性和语义可能性。使用CLIP余弦相似度等常见方法,难以区分空间与语义相近且可能容纳目标的物体。我们提出LOCUS,即利用空间图进行地标导向容器辨别的方法。为联合推理空间信息和语义,我们训练GNN在完整环境场景图上更新CLIP嵌入,根据节点邻近关系传递嵌入信息。融合家居本体语义知识的CLIP嵌入提供稳健语义信号。我们在由模拟器元数据构建的无噪声场景图上评估,因此该评估不依赖检测器。在大多数房间类别和配置中,方法优于随机、CLIP、Tidybot及LLM规划器。为说明方法对场景图节点位置与标签噪声的稳健性,我们展示真实移动操作机器人从头至尾运行探索管线,其中场景图标签来自Detic。