论文
SpaMEM:通过具体环境中的感知记忆集成对动态空间推理进行基准测试
SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments
摘要
多模态 大语言模型 (MLLM) 具有先进的静态视觉空间推理,但它们往往无法在具体环境中保持长期空间连贯性,在具体环境中,信念必须根据环境变化下的自我中心观察不断修正。我们引入了 SpaMEM(来自动作序列的空间记忆),这是一种大规模诊断基准,它通过长交互范围内的动作条件场景转换(生成、放置、移除)来隔离空间信念演化的机制。 SpaMEM 基于物理数据集构建,包含 10,601,392 个跨四种模式(RGB、深度、实例、语义分割)的高保真图像,这些图像是从 1,000 个程序生成的房屋中的 25,000 多个交互序列中收集的。我们将体现空间推理形式化为具有 15 个诊断任务的三级层次结构:第 1 级测量来自单个观察的原子空间感知;第 2 级利用 Oracle 文本状态历史探索时间推理,以排除感知噪声;第三级需要在相同的任务维度下从原始视觉流进行端到端的信念维护。我们进一步评估短期(逐步)更新和长期(情景)重建。对代表性开源 VLM 系列进行基准测试揭示了一个一致的堆叠瓶颈:坐标一致的基础仍然是一个硬天花板,从 2 级到 3 级的急剧崩溃暴露了明显的符号脚手架依赖性,模型在基于文本的簿记方面取得了成功,但难以维持强大的视觉记忆。 SpaMEM 提供了精细的诊断标准,并激发了用于状态表示、信念修正和长期情景集成的明确机制。 SpaMEM 的一个子集可在 https://huggingface.co/datasets/mill-ct-liao/SpaMEM 上公开获取。