论文
HiMe:用于长视野视觉-语言-动作控制的分层体现记忆
HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control
摘要
当前的视觉-语言-动作(VLA)模型擅长机器人操作,但由于依赖即时观察,常常难以处理需要长期记忆和推理的非马尔可夫任务。现有的解决方案面临着“频率能力悖论”,即更强的推理模型对于实时控制来说太慢,而更快的模型缺乏足够的推理能力。为了解决这种架构上的错位,我们提出了 HiMe,这是一种分层体现记忆框架,它将体现智能解耦为用于执行的高频执行器、用于工作记忆的哨兵和用于长期策略的规划器。我们还引入了基于跨模态语义模式和主动管理机制的动态知识系统,允许机器人通过“添加、更新和删除”操作来保持记忆可塑性。这种分层设计有效平衡了实时执行和慢速思考规划之间的冲突,显着提高了长期任务的成功率。实验表明,这种方法不仅优于平坦记忆基线,而且还表现出根据人类偏好自我纠正其内部知识的新颖能力。