论文
开放世界任务执行中基于 VLA 的代理的长期记忆
Long-Term Memory for VLA-based Agents in Open-World Task Execution
摘要
视觉-语言-行动(VLA)模型已展现出在具体决策方面的巨大潜力;然而,它们在复杂化学实验室自动化中的应用仍然受到有限的长期推理和缺乏持续经验积累的限制。现有框架通常将规划和执行视为分离的过程,通常无法整合成功的策略,从而导致多阶段协议中的试错效率低下。在本文中,我们提出了 ChemBot,这是一个双层闭环框架,它将自主 AI 代理与进度感知 VLA 模型(Skill-VLA)集成在一起,用于分层任务分解和执行。 ChemBot 利用双层内存架构将成功的轨迹整合为可检索的资产,而模型上下文协议 (MCP) 服务器则促进高效的子代理和工具编排。为了解决 VLA 模型的固有局限性,我们进一步实现了基于未来状态的异步推理机制,以减轻轨迹不连续性。对协作机器人的大量实验表明,与复杂的长视野化学实验中现有的 VLA 基线相比,ChemBot 实现了卓越的操作安全性、精度和任务成功率。