论文

ABot-AgentOS:带终身多模态记忆的通用机器人智能体操作系统

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

智能体系统上下文与知识记忆Agent HarnessAgent记忆Agent Runtime

摘要

近期的VLM与VLA系统改善了机器人感知与动作预测,但长程具身智能体仍需要一个通用运行时层:覆盖推理、记忆、工具使用、验证与跨本体执行。我们提出ABot-AgentOS:一个位于底层控制器之上的通用机器人智能体操作系统,提供面向场景条件的规划、上下文隔离的技能执行、多阶段验证、多模态记忆与边云协作的深思式智能体层。为评估此类系统,我们引入EmbodiedWorldBench:一个可执行基准,含16个室内、室外与混合场景、四个难度级别、超过200个涉及导航、目标搜索、NPC对话、动态事件与轨迹落地评分的任务。ABot-AgentOS进一步引入通用多模态图记忆:一个持久的、来源落地的基底,把对话、视觉观察、空间上下文、时间关系与任务轨迹转为类型化节点与边。失败驱动的自进化回路把诊断出的记忆失败转为门控的运行时进化资产——仅提升到后续评估划分,防止当前划分的真值泄漏,同时支持持续改进。在初始EmbodiedWorldBench子集上,ABot-AgentOS在任务成功与目标完成上都超过单控制器基线。跨记忆基准:ABot-AgentOS Static取得LoCoMo 87.5、OpenEQA EM-EQA 59.9、Mem-Gallery 88.6、NExT-QA Acc@All 76.5;自进化进一步把LoCoMo提至88.7、OpenEQA至60.4、Mem-Gallery至89.0。结果表明通用Agent OS层能改善长程具身执行,同时为持续交互提供持久、可审计的记忆。

ABot-AgentOS:带终身多模态记忆的通用机器人智能体操作系统:论文配图
图 1:所提出的机器人代理的系统架构。从多个来源(麦克风、APP、摄像头)到双 LLM 核心的输入,其中边缘的小型 LLM 处理每个回合,并根据需要升级为基于云的大型 LLM。 Agent Harness 管理验证感知的 ReAct 循环、上下文和技能发展,从而实现可扩展的技能库(操作、导航、运动、视觉等)。分层内存系统将私有边缘内存与共享云内存同步,以支持跨机器人知识传输。输出被分派到机器人硬件以供执行。