论文
MobiAgent:长程移动操作的双循环递归策略自改进
MobiAgent: Dual-Loop Recursive Policy Self-Improvement for Long-Horizon Mobile Manipulation
摘要
长程移动操作因执行误差复合与运动/手臂控制的容量干扰而挑战巨大。近期VLA模型擅长短程任务,却缺乏多阶段目标所需的分层推理;既有分层Agentic 智能体还受刚性子任务映射、不灵活重规划与缺乏持续学习之苦。为解决这些限制,我们提出MobiAgent——桥接鲁棒部署执行与递归策略自改进的双循环智能体框架:部署时内环通过高度可组合的原子技能把高层推理与低层控制解耦,用视觉语言模型做滚动时域规划与视觉反思,动态组合技能确保鲁棒的错误恢复;这些技能由共享统一VLM骨干的专门流匹配专家执行,最大化复用并缓解容量干扰。同时外环驱动自动化终身学习:自主分割并验证部署rollout、聚类发现原子技能、并在无人工标注下持续微调技能库。RoboCasa、BEHAVIOR-1K与真实任务评估证明MobiAgent有效性:在BEHAVIOR-1K超π0.5-TA 22.5个百分点并能从执行失败鲁棒恢复;经自主数据回收,RoboCasa成功率从7.50%升至27.50%、Astribot S1从32.5%升至57.5%。