论文
用质量-多样性优化为多模态具身智能体发现多样化规划策略
Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization
摘要
多模态具身智能体越来越多地被要求将视觉观察、文本目标与交互历史整合进闭环决策,以解决长程任务。然而,最先进的基于大模型的规划器在执行时往往依赖单一主导规划风格。一旦这种执行模式失效,智能体可能停滞多步,反复与环境交互却没有实质进展。为此我们提出一个质量-多样性(QD)框架,用于为多模态具身智能体发现多样化的规划策略。该方法把规划策略模板视为可进化的个体,并将其组织进按行为索引的档案,而不是把搜索坍缩为单一提示词风格。在离线阶段,回放轨迹被总结为结构化的成功与失败经验,通过重组与经验引导的变异指导策略变化。所得策略被映射到由交互强度与目标导向性定义的行为空间,每个生态位中质量最高的策略被保留在档案中。在线阶段,智能体一次执行一个策略并监测任务进度。当检测到持续停滞时,系统回滚到最新检查点,并切换到行为上截然不同的档案策略以恢复执行。在ThreeDWorld运输基准上的实验表明,所提框架在任务成功与交互效率两方面均优于代表性基线规划器。这些结果表明,发现多样化的策略库是支持自适应多模态规划与在线失败恢复的有效途径。
