论文
实践:从经验到自我进化具体代理的专业知识
PRACTICE: From Experience to Expertise in Self-Evolving Embodied Agents
摘要
最近的研究表明,多模态 大语言模型 (MLLM) 可以作为具体代理,将语言指令和视觉观察转化为可执行计划。然而,构建能够通过交互不断改进并快速适应环境的代理仍然具有挑战性。总结过去交互轨迹的经验提供了一个有前途的解决方案,但现有的基于经验的方法通常依赖于手动设计的提示工作流程来提取和更新技能。这种固定的程序可能很难从新的、多样化的经历中学习更新的技能。我们引入了实践,它训练技能学习者从过去的交互轨迹中发现并维护持久的技能库,同时保持任务执行者冻结。考虑到历史积累的技能和传入轨迹,技能学习者会生成结构化的批量编辑,以添加、细化、合并或删除技能,然后将所有收集的编辑分层合并到一致的更新技能库中。我们通过两阶段课程对学习者进行培训。首先,它从预言机轨迹中学习基本技能生成和库维护。然后,通过对比同一任务上不同执行者的成功和失败轨迹,它学会识别无效的行动模式和恢复策略。最后,我们应用在线技能编辑 蒸馏 将技能学习者与当前编辑分布上更强大的老师对齐,以进一步改进策略。实验表明,紧凑的技能学习器可以在多个冻结执行器的连续库更新轮次中提供一致的性能改进。在 EB-ALFRED 和 EB-Habitat 上,PRACTICE 的表现进一步优于最强大的基于经验的基线。项目资源可公开获取:https://baai-agents.github.io/PRACTICE