论文
开放词汇 3D 指令歧义检测
Open-Vocabulary 3D Instruction Ambiguity Detection
摘要
在安全关键领域,语言歧义可能造成严重后果;外科场景中一句含糊的命令(如“把药瓶递给我”)可能导致灾难性错误。然而,大多数具身AI研究忽视了这一点,默认指令是清晰的,并将重心放在执行而非确认上。为弥补这一关键安全空白,我们首次定义了3D指令歧义检测这一基础性新任务:模型必须判断一条命令在给定3D场景中是否具有单一、无歧义的含义。为支持这项研究,我们构建了该任务的大规模基准Ambi3D,包含700多个多样化3D场景和约2.2万条指令。我们的分析揭示了一个出人意料的局限:最先进的3D大语言模型(LLM)难以可靠地判断指令是否存在歧义。为应对这一挑战,我们提出AmbiVer,一个两阶段框架,从多个视角收集显式视觉证据,并用其引导视觉语言模型(VLM)判断指令歧义。大量实验证明了该任务的挑战性与AmbiVer的有效性,为更安全、更可信的具身AI铺平了道路。代码与数据集见 https://jiayuding031020.github.io/ambi3d/。
