论文
将全模式实体代理从孤立的技能推进到日常的身体自主
Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
摘要
在非结构化环境中构建持久的实体代理需要跨网络(API、物联网)和物理(操作、导航)域的异构工具进行统一编排,并从扩展操作中不可避免地出现的物理故障中进行自主恢复。现有系统将这些问题视为单独的问题:基于 VLM 的规划器缺乏统一的网络物理操作空间,代理框架积累了无界的上下文,从而降低了时间一致性,并且 VLA 策略执行开环而没有检测到自身的故障。我们认为,持久自治不需要单一模型,而是需要明确分离规划、内存和验证的分层异步架构。为此,我们提出了 OmniAct,一个框架,集成了用于跨统一动作空间的技能路由的多模态语义规划器、具有用于次线性上下文增长的事件边界驱动压缩的自适应分层存储器,以及在物理执行期间关闭语义循环的异步视觉抢占引擎。在协调四个物联网设备的两个机器人平台上的 40 个现实世界长期任务中,OmniAct 在所有复杂性级别上实现了端到端成功的持续改进,在超过 10 万个累积交互词元上保持近乎持平的词元消耗,并将中型开放权重模型提升到专有级别的性能。