论文
记忆基础:3D 功能可供性的跨场景和场景内记忆
Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances
摘要
功能可供性基础需要的不仅仅是识别一个对象:智能体必须定位支持交互的特定区域,例如拉动的手柄或按下的按钮。这对于 无需训练 视觉语言管道来说很困难,因为可操作区域通常很小,视觉上不明确,并且在场景中的多个相同类别实例中重复。我们提出了 AFFORDMEM,这是一个通过记住两个层面的几何形状来支持 3D 功能可供性的框架。第一个是跨场景可供性记忆:代理维护 RGB 图像的类别级内存库,其中可供性区域呈现为覆盖层,并在查询时回忆起信息最丰富的示例,以引导冻结的 VLM 走向纯文本提示始终会错过的小型可操作子区域。第二个是场景内空间记忆:当代理处理场景时,它将候选实例及其 3D 空间关系组织成结构化场景图,使语言模型能够解析对远处或当前未观察到的候选者的引用,例如“从顶部开始的第二个句柄”。 AFFORDMEM 不需要模型 微调,也不需要目标场景注释,使用从源场景构建的可重用内存库。在 SceneFun3D 上,我们的方法相对于之前的 无需训练 技术水平,在 Split 0 上将 AP50 提高了 3.23,在 Split 1 上提高了 3.7。消融研究支持互补优势:跨场景可供性记忆改进了细粒度定位,而场景内空间记忆则为空间限定查询提供了更大的增益。项目主页可在项目页面找到。