论文

InterEvolve:人形机器人奖励计划的测试时演化

InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation

智能体系统Agent 规划

摘要

我们研究人形机器人操纵的测试时演化:通过重新利用其现有技能、从自己的尝试中改进并保留其所学知识来解决控制器从未接受过训练的任务,而无需重新训练。我们的主要见解是,广泛的控制器已经拥有新任务所需的大部分能力,并且这种能力可以通过规划和控制之间的接口来访问,该接口具有足够的表现力,可以指定丰富的接触、多阶段交互,但又具有足够的可执行性和可测量性,使得执行反馈可以根据经验指导规划。 InterEvolve 使用两个组件实现此接口。首先,我们开发了一个对象感知的前向-后向(FB)行为基础模型,其在冻结身体上的对象残差会在测试时将关于身体或对象的新奖励转化为局部操纵行为。其次,我们将任务指定为奖励计划:具有完成条件和可调常量的阶段性奖励。大语言模型(LLM)Agent根据执行反馈和经过验证的程序的技能库修改上下文中的程序结构,而数值优化器则调整其常量。通过并行模拟场景验证每个候选者,该程序探索新的方法来诱导、重新利用和组合控制器现有的运动能力来完成手头的任务,从而在迭代中得到改进。实验表明,人类设计的奖励使 FB 模型的大部分局部操纵能力未被开发,而 InterEvolve 开发的程序有时会通过新颖的策略来释放它。它进一步在模拟中产生针对不同任务、复杂场景和长程构图的行为,并通过以自我为中心的机载感知在物理 Unitree G1 上自主运行进化技能。