论文

用质量-多样性优化为多模态具身智能体发现多样化规划策略

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

智能体系统Agent 规划Agent Harness

摘要

多模态具身智能体越来越多地被要求将视觉观察、文本目标与交互历史整合进闭环决策,以解决长程任务。然而,最先进的基于大模型的规划器在执行时往往依赖单一主导规划风格。一旦这种执行模式失效,智能体可能停滞多步,反复与环境交互却没有实质进展。为此我们提出一个质量-多样性(QD)框架,用于为多模态具身智能体发现多样化的规划策略。该方法把规划策略模板视为可进化的个体,并将其组织进按行为索引的档案,而不是把搜索坍缩为单一提示词风格。在离线阶段,回放轨迹被总结为结构化的成功与失败经验,通过重组与经验引导的变异指导策略变化。所得策略被映射到由交互强度与目标导向性定义的行为空间,每个生态位中质量最高的策略被保留在档案中。在线阶段,智能体一次执行一个策略并监测任务进度。当检测到持续停滞时,系统回滚到最新检查点,并切换到行为上截然不同的档案策略以恢复执行。在ThreeDWorld运输基准上的实验表明,所提框架在任务成功与交互效率两方面均优于代表性基线规划器。这些结果表明,发现多样化的策略库是支持自适应多模态规划与在线失败恢复的有效途径。

用质量-多样性优化为多模态具身智能体发现多样化规划策略:论文配图
图2:所提出框架的概览。该方法包含离线档案构建阶段与在线自适应恢复阶段。离线阶段,种子规划策略模板通过重组与经验引导的变异进行演化。策略rollout产生轨迹统计信息,从中提取成功模式与失败模式并存入经验缓冲区。策略被映射到由交互强度与目标导向性定义的行为空间,每个生态位中质量最高的策略存入以行为索引的档案。在线阶段,智能体执行一个策略并监控任务进度。当检测到持续性停滞时,系统回滚至最近的检查点,并切换到从档案中检索出的行为上不同的策略。由此,离线发现的行为多样性成为在线执行期间实用的恢复资源。框架概览:离线档案构建与在线自适应恢复。