论文
从失败到监督:用于稳健的长期具体规划的 DynamicEnvPlan
From Failures to Supervision: DynamicEnvPlan for Robust Long-Horizon Embodied Planning
摘要
物理世界的交互本质上是动态的,因为环境在执行过程中会发生变化,要求代理在非静态条件下调整他们的计划。我们通过环境偏差和执行不确定性下的长期具体规划来研究这一挑战。现有的具体任务基准可以暴露此类故障,但这些故障通常被视为评估结果,而不是用于训练代理恢复的可学习信号。在这项工作中,我们介绍了 DynamicEnvPlan,一个用于动态环境中高级规划的闭环框架。它通过人形代理、高级原始技能、结构化语义记忆和可控扰动来扩展具体任务执行。我们的数据合成设计由规划、扰动和保护校正模块组成,这些模块将动态执行状态转换为面向恢复的跟踪。生成的轨迹用于分阶段监督 微调,使规划器能够从名义执行和扰动恢复轨迹中学习。 DynamicEnvPlan 使用 104 个任务场景组合,涵盖独立同分布、组合泛化以及 微调 和评估的分布外设置,将基本规划器的成功率从 33.3% 提高到 76.2%,同时改进对物理世界交互至关重要的所有七个评估指标,包括安全性和可供性合规性。