论文

RenderMem:将渲染作为空间记忆检索

RenderMem: Rendering as Spatial Memory Retrieval

上下文与知识记忆Agent记忆

摘要

具身推理本质上依赖视角:什么可见、什么被遮挡、什么可达,都关键地取决于智能体所处的位置。然而,现有的具身智能体空间记忆系统通常存储多视角观测或以对象为中心的抽象,难以进行具备显式几何根据的推理。我们提出RenderMem,一个将渲染视为三维世界表征与空间推理之间接口的空间记忆框架。RenderMem不存储固定观测,而是维护三维场景表征,并通过从查询所蕴含的视角渲染场景来生成以查询为条件的视觉证据。这使具身智能体能够从任意视角直接推理视线、可见性与遮挡。RenderMem与现有视觉语言模型完全兼容,无需对标准架构做任何修改。在AI2-THOR环境中的实验表明,其在依赖视角的可见性与遮挡查询上相较既有记忆基线取得了一致的改进。

RenderMem:将渲染作为空间记忆检索:论文配图
图1:RenderMem通过渲染查询条件下的视角,从存储的3D场景中检索空间证据,作为视觉记忆读出,支撑可见性与物体状态的推理。