论文

ECHO:视觉-语言-动作模型的连续分层记忆

ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models

摘要

记忆容量是决定视觉-语言-动作(VLA)模型在长视野操作任务中性能的关键因素。现有的记忆增强架构主要依赖于线性或平面存储,缺乏操作类别和分层组织的结构先验。这种缺陷阻碍了有效的经验检索,并限制了对看不见的长期任务组合的泛化。受人类经验分层组织的启发,我们提出了 ECHO(体验巩固和分层组织),这是一种在连续分层空间中运行的新型记忆框架。通过采用双曲自动编码器,ECHO 将 VLA 隐藏状态映射到该空间。利用双曲度量和蕴涵约束机制,经验向量被组织成语义记忆树,支持高效的自上而下检索。同时,后台整合机制通过几何插值和结构分裂不断细化记忆树,支持连续空间中的虚拟记忆合成。我们将 ECHO 集成到 $π_0$ 基础模型中。对 LIBERO 和初步现实世界实验的评估证明了我们方法的有效性,特别是在 LIBERO-Long 上的 $π_0$ 基线上,执行成功率绝对提高了 12.8%,同时提高了跨套件未见的长期任务的组合泛化。