论文

AtlasVA:无需教师的 VLM 代理的自我进化视觉技能记忆

AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents

上下文与知识记忆Agent记忆

摘要

视觉语言模型(VLM)智能体越来越依赖记忆增强强化学习来重用长期任务中的经验,但大多数现有框架将记忆存储为文本,并依赖专有的教师模型来总结或完善它。这种设计与空间决策的匹配度很差:几何先验被压缩为有损语言,并且稀疏交互通常通过延迟的文本反馈而不是密集的视觉基础信号来监督。我们认为,VLM 代理的可重用体验应该保持视觉基础。基于这一见解,我们提出了 \textbf{AtlasVA},这是一种无教师的视觉技能记忆框架,它将记忆组织成三个互补的层:空间热图、视觉范例和符号文本技能。 AtlasVA 进一步直接从轨迹统计和轻量级网格启发式中演化出危险和亲和力图集,并将这些自我演化图集重新用作强化学习的基于潜力的塑造奖励。这统一了感知、记忆和优化,无需外部 LLM 监督。 \textsc{Sokoban}、\textsc{FrozenLake}、3D 体现导航和 3D 机器人操作基准测试表明,AtlasVA 始终优于以文本为中心的内存基线和竞争性 VLM 代理,尤其是在空间密集型任务上取得了显着的进步。主页:https://wangpan-ustc.github.io/AtlasvaWeb