论文

从USD场景到知识图谱:用大语言模型进行零样本本体映射

From USD Scenes to Knowledge Graphs: Zero-Shot Ontology Grounding with LLMs

上下文与知识知识图谱

摘要

从 3D 模拟场景构建知识图对于机器人任务推理至关重要,但关键瓶颈是将场景对象映射到形式化本体类别,仍然依赖于手动管理的字典,这些字典很脆弱并且不能跨资产泛化。我们研究 大语言模型 (LLM) 是否可以自动执行通用场景描述 (USD) 场景的这一映射步骤,作为零样本 无需训练 替代方案。在使用 SOMA-HOME Ontology 的厨房场景(125 个对象)上,LLM 对描述性名称的精确匹配精度达到 90-96%,对缩写名称的精确匹配精度达到 49-89%,大大优于字典和嵌入基线。在完全不透明的名称下,上下文增强提示可恢复高达 48%。特征消融表明,LLM 主要利用场景图中的语义线索(兄弟名称和父路径);匿名化这些线索会将准确率降低至 0-6%,而仅几何图形只能产生 4-17%。