论文
超越扁平策略:机器人操作中实体代理的分层 后训练
Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation
摘要
通过利用预训练的视觉语言模型,视觉语言动作(VLA)模型在机器人操作方面展示了卓越的能力。然而,现有的 后训练 方法主要将 VLA 模型优化为平面策略,这使得显式建模任务进展和执行稳健的长范围操作变得困难。尽管分层方法引入了任务分解,但它们主要依赖于离线演示的监督学习,无法通过在线交互有效提高执行力。为了解决这一限制,我们提出了分层机器人控制(HiRoC),这是一个分层 后训练 框架,可将高层任务规划与底层操作执行分离。规划器将复杂的任务分解为可执行的子目标,以提供明确的语义指导,而执行器则通过强化学习不断改进子目标条件的动作生成。为了实现两个模块之间的有效协作,我们在强化学习之前进一步将执行器与规划器生成的子目标对齐,从而减轻规划和执行之间的分布失调。跨不同机器人操作基准的广泛实验表明,HiRoC 始终优于强大的基准。综合分析进一步验证了分层后训练的有效性以及每个关键组件的贡献。