论文

开放词汇 3D 指令歧义检测

Open-Vocabulary 3D Instruction Ambiguity Detection

模型评测基准与评测资源

摘要

在安全关键领域,语言歧义可能造成严重后果;外科场景中一句含糊的命令(如“把药瓶递给我”)可能导致灾难性错误。然而,大多数具身AI研究忽视了这一点,默认指令是清晰的,并将重心放在执行而非确认上。为弥补这一关键安全空白,我们首次定义了3D指令歧义检测这一基础性新任务:模型必须判断一条命令在给定3D场景中是否具有单一、无歧义的含义。为支持这项研究,我们构建了该任务的大规模基准Ambi3D,包含700多个多样化3D场景和约2.2万条指令。我们的分析揭示了一个出人意料的局限:最先进的3D大语言模型(LLM)难以可靠地判断指令是否存在歧义。为应对这一挑战,我们提出AmbiVer,一个两阶段框架,从多个视角收集显式视觉证据,并用其引导视觉语言模型(VLM)判断指令歧义。大量实验证明了该任务的挑战性与AmbiVer的有效性,为更安全、更可信的具身AI铺平了道路。代码与数据集见 https://jiayuding031020.github.io/ambi3d/。

3D指令歧义检测 配图
图 2:AmbiVer 框架概览。AmbiVer 是一个由感知引擎与推理引擎组成的两阶段系统。感知阶段将指令解析为动作、属性、关系与目标组件,采用开放词汇定位方法跨视角检测 2D 候选,并通过基于射线的融合及后续精化将它们整合为 3D 实例。它还生成用于场景级上下文的 BEV 地图。随后,推理阶段执行多模态证据捆绑,并利用 VLM 评估指令的歧义性,输出结构化裁决。