论文

GeneralVLA-2:用于机器人规划的几何感知重建和受控内存

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

上下文与知识记忆Agent记忆

摘要

通用视觉-语言-动作系统需要以对象为中心的 3D 证据和可重复使用的操作经验来规划可靠的机器人轨迹。 GeneralVLA 提供了一个分层接口,用于将语言和 RGB-D 观察结果转换为 3D 末端执行器路径,但仍然存在两个瓶颈。首先,单目 SAM3D 式对象重建可以产生幻觉姿势和看不见的几何形状,而当校准的多视图观察可用时,操作可以受益于稳定的对象形状。其次,原始知识库主要检索语义相似的片段并附加新知识,这使得难以控制记忆质量、冲突、置信度和几何相关性。为了解决第一个挑战,我们引入了 GeoFuse-MV3D,这是一个几何先验引导的 MV-SAM3D 重建分支,它使用输入视图蒙版验证外部几何线索,应用软视觉外壳支持,执行轴方向细化,并在保留外观的同时仅融合几何图形。为了解决第二个挑战,我们将 KnowledgeBank 升级为受管理的长期记忆系统,具有明确的质量、置信度、生命周期、验证者和冲突元数据,以及面向精度的检索。最后,我们在 GSO-30 上评估重构分支,在 Terminal-Bench 2.0 和 SWE-Bench Verified 上评估内存模块; GeoFuse-MV3D 在 MV-SAM3D 基线的基础上进行了改进,将 CD 和 LPIPS 降低了 2.20% 和 2.02%,同时将 PSNR 和 SSIM 提高了 2.36% 和 1.03%,KnowledgeBank 在 Terminal-Bench SR 上比 ReasoningBank 提高了 4.53%,在 SWE-Bench 解析率上提高了 3.73%,同时将 AS 降低了 4.95% 和 5.65%,分别。代码:https://github.com/AIGeeksGroup/GeneralVLA-2。网站:https://aigeeksgroup.github.io/GeneralVLA-2。