论文

3D-VCD:通过视觉对比解码减轻 3D-LLM 实体代理中的幻觉

3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding

模型推理解码与生成控制

摘要

大型多模态模型越来越多地用作在 3D 环境中运行的实体代理的推理核心,但它们仍然容易产生幻觉,从而产生不安全和无根据的决策。现有的推理时间幻觉缓解方法主要针对 2D 视觉语言设置,并且不会转移到具体 3D 推理,其中失败源于对象存在、空间布局和几何基础,而不是像素级不一致。我们引入了 3D-VCD,这是第一个用于减轻 3D 实体代理幻觉的推理时间视觉对比解码框架。 3D-VCD 通过将语义和几何扰动应用于以对象为中心的表示(例如类别替换和坐标或范围损坏)来构造扭曲的 3D 场景图。通过对比原始和扭曲的 3D 上下文下的预测,我们的方法抑制了对实际场景证据不敏感的标记,因此可能由语言先验驱动。我们在 3D-POPE 和 HEAL 基准上评估 3D-VCD,结果表明它无需任何再训练即可持续改进基础推理,在结构化 3D 表示上建立推理时间对比解码,作为实现更可靠的体现智能的有效且实用的途径。