论文
MM-Conv:3D 对话中上下文感知基础的多模态数据集和基准
MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue
摘要
物理世界中的基础语言需要人工智能系统来解释对话过程中动态出现的参考内容。虽然当前的视觉语言模型(VLM)擅长静态图像任务,但它们很难解决自发的多轮对话中的模糊表达。我们通过引入(1)动态 3D 环境中的参考通信基准来解决这一差距,该基准是通过 6.7 小时的以自我为中心的 VR 交互与同步语音、运动、凝视和 3D 场景几何图形构建的,以及(2)一个两阶段的基础管道,可在视觉定位之前明确解决对话歧义。该基准包括 4,200 多个手动验证的指代表达式,涵盖完整、部分和代词类型。我们的上下文重写方法平均将目标定位性能提高了 11-22 个百分点,纯检测器 (GroundingDINO) 在重写后在代词上达到 56.7%,几乎是最佳端到端基线的两倍。结果表明,将语言推理与视觉感知分离比会话基础的端到端方法更有效。